OpenAI核心研究者为何转身做不生成文字的模型
过去一周,Jev 成为 AI 圈最火的新模型。它主打 System One 快思考,只负责“判断”,基于 RLCD,只输出选择、概率和置信度。创始人 Diogo Almeida 曾在 OpenAI 参与 InstructGPT、ChatGPT 和 GPT-4 等研究,也是把 RLHF 推向大规模应用的核心研究者之一。离开 OpenAI 后,他选择几乎相反的方向:不再训练更会说话的模型,而是做一个完全不生成文字的模型。
Jev 背后的公司叫 TypeSafe。9 月 15 日,TypeSafe 结束两年隐身期,发布 Jev,并宣布完成由 DCVC 领投的 4000 万美元种子轮融资。
Diogo Almeida 在发布前一个多月的演讲中提出:如果整套 AI Stack 都围绕可靠性和自动化重新设计,会变成什么样?他认为,今天整个领域的许多现象,都可追溯到设计 ChatGPT 背后算法时的细微决定。模型在 Benchmark 上不断进步,能自主运行的时间也越来越长,但一些简单工作仍需人。原因在于,表现惊人的任务本就是为了取悦处在 loop 中的人,而基础任务的目标恰恰是把人移出 loop。这就是辅助与自动化的分界。
RLHF 收集人类偏好并针对偏好优化,等于把人放进了训练 loop,目标是让人满意,而非让软件自主运行。用户一直在 loop 中时这说得通,但若要自动化,模型应别管人类喜不喜欢,只以经过校准的方式把任务做对。因此,下一个时代不是 Claude Code 时代,它仍属辅助时代,仍使用 RLHF。
Diogo Almeida 认为,预训练本身不是问题,问题在于怎样释放智能。后训练像一棵树:RLHF 优化人类偏好,RLVR 优化可验证的正确性和低错误率,TypeSafe 做第三种——优化经过校准的决策。选择正确任务远比单纯增加数据和算力重要。他相信,辅助之后的下一个阶段是真正的自动化,尽管今天真正被自动化的工作仍只是舍入误差。
Jev 爆火后,Diogo Almeida 在播客中表示,开发者开始理解他们想做什么。他称 Jev 为 System 1 模型,更准确的说法是“机器原生、大型、可编程”,目标是让代码成为输出的消费者。Jev 提供 Choice、Score 和 Noul 三种输出:Choice 从预设选项中做选择,接近函数调用中的选择;Score 用于排序或与阈值比较;Noul 回答“是或否”,但返回概率,程序据此决定是否执行 if 分支。这些是有意设计的新概念,直接塞进整数或浮点类型容易被误解。
输入方面,state、instructions、criteria 都可以是结构化 JSON,不必先拼成巨大字符串模板。他建议拆出许多小问题,清楚定义,必要时并行调用,让代码结构更好、行为更易验证。程序控制应尽量由程序完成,而非只塞进大提示词祈祷模型遵守。
但拆成上百次调用有时会更慢、更贵、效果更差。要尽量拆到最小语义单元,让每个问题清楚、可测量,再由代码决定最终行为。比如不要只问“要不要拒绝这个请求”,而应针对各种拒绝条件分别提问并设阈值。发现漏掉一种情况,就增加一个问题、阈值和测试用例;处理不好就转人工。这样至少能看清哪一步出问题,并持续测量。

不过,并非任何复杂任务都能这样拆。单步判断很强,但多步推理随步骤增加会逐渐下降。什么任务适合 System 1,最终要看实际效果。RLVR 在复杂推理上的进展也很惊人,但那类任务和快速判断不是同一回事。校准和置信度也并非完美,模型会犯很多错,眼下必须承认技术有边界。
更多推荐阅读

平头哥真武V900发布:AI算力从单卡走向千卡互联
从真武 V900 到新一代磐久超节点服务器,平头哥八年来布局的 AI 芯片、CPU、scale up 互联、scale out 网络和存储芯片,开始被装进同一套算力系统。9 月 22 日 2026 杭州云栖大会上,平头哥被完整推到主论坛台前,副总裁高慧发表题为「Agentic 时代卓越算力基石」的演讲,发布从真武 V900 芯片到 ICN Switch 互联芯片、磐脉智能网卡、镇岳 SSD 主控、...
2026-09-23
陆川用AI五天复原明代大爆炸,阿里全模态模型兜底影视生产
不用搭景,不用等演员,导演陆川和团队用AI把一场400年前的明代灾难现场做了出来。宫廷、火药库,以及史料中烟云如黑灵芝的大爆炸,按传统影视工业做法往往需要数月时间和千万级投入,这次只用了5天。 人物的脸、皮肤、神态已相当逼真,爆炸的烟尘、碎片、火光也稳稳接住。过去光是一场爆炸戏就要耗费19天。陆川团队把史料文字翻译成现代视觉概念,前后做了约四轮提示词优化,再参考真实爆炸影像校准。阿里视频生成模型...
2026-09-23
OpenAI新模型24天攻克100+数学难题
数学界正被AI迅速逼近。OpenAI一篇重磅博文披露,一款8月28日才开始训练的内部新模型,已攻克100多道世界级数学难题,横跨数学大部分领域,其中包括困扰学界多年的“纳维–斯托克斯”千禧年难题。从开训到9月21日官宣仅24天,进化速度令OpenAI内部数学家都感到意外。 9月8日,OpenAI称该内部模型在88小时内攻克NS千禧年难题,给出NS方程存在性与光滑性问题的证明,并公开166页论文和...
2026-09-23
国产AI生图新高度:真假难辨,还能精修到商用
两张图都是AI生成的,来自商汤科技正式上线的SenseNova U1 Pro,目前可在商汤小浣熊平台使用,API已向企业客户开放。 实测在SenseNova Studio平台进行,模型支持2K起步、最高4K清晰度。第一轮测试将一张生活照重构为纸质风格,随后仅修改人物外套内的黑色圆领T恤为白色,要求严格限定在可见内搭区域。由于T恤、皮带、裤子均为黑色且有胸牌遮挡,边界易混淆,但U1 Pro精准拿捏...
2026-09-23
剪映发布全新AI创作能力:从专业剪辑到普通用户全面提效
剪映在2026 AI新创作发布会上发布全新AI能力,覆盖PC专业版与App端,分别聚焦“提效”与“省心”。 PC专业版推出剪映Hub,一站式AI创作平台,将AI创作与多轨道剪辑连接,让脚本、素材与创作上下文在同一项目中延续,减少跨工具切换的断点与重复操作。剪映助手Agent介入专业创作流程,承担素材整理、粗剪、包装等工作,可根据创作目标规划任务、串联模型工具并自动运行,用户也可自定义工作流,沉淀...
2026-09-23
AI操控游戏新选择:Jev模型到底能做什么?
Jev 是 TypeSafe AI 推出的决策模型,创始人 Diogo Almeida 曾在 OpenAI 参与指令跟随与对话研究。TypeSafe 开发两年后发布该系统,官方称为 System One Models。其使用方式是把当前情况和问题输入,模型返回程序可直接使用的结果,本质上是分类模型,接口主要有三种类型。 在游戏场景中,可每一步询问它:当前血量、怪物和金币位置、出口位置,目标是拿金...
2026-09-23