前OpenAI研究员造出“闭嘴”模型,2400万人围观
前 OpenAI 研究员 Diogo Almeida 结束两年隐身,发布新模型 Jev。他曾是 InstructGPT 论文共同作者,参与早期 RLHF 与 GPT-4 工作,但离开后开始怀疑“聊天能力是否真是软件自动化的核心”。TypeSafe 推出的首款 System One Model Jev 放弃自由文本生成,官方称速度提升 20-200 倍,成本最高降至 1/400,输出 Token 免费。

传统大模型需逐 Token 生成回答,程序再解析字段;Jev 则直接输出类型确定的结构化判断及概率、置信度,即“非结构化状态进去,带类型的概率决策出来”,且结果可并行产生。官方称端到端响应约 70-500 毫秒,输入每百万 Token 0.042 美元,输出免费;内部 workflow eval 最高测得 193.6 倍速度优势和 444.6 倍成本优势,但 TypeSafe 承认测试来自内部团队,可能接近收益高位。外部实测中,Every 评测负责人 Mike Taylor 用 Jev 检查 37 篇文档,完成 777 次独立判断,总耗时不到 0.7 秒;一项写作质量判断中,Jev 约 0.35 秒,Fable 5.1 需 8.83 秒,前者快约 25 倍,成本低约 580 倍。

Jev 采用新训练方法 RLCD,即面向校准决策的强化学习,回应 RLHF。Almeida 认为模型进入软件系统后,人的偏好未必最重要,关键是答案及确定性。RLCD 把校准放核心:若模型长期对某类判断给出 90% 置信度,这些判断最好真有约 90% 正确。软件可据此写逻辑:95% 以上直接执行,70% 交给更强模型,40% 送人类。AI 更像可插入程序的“模糊 if 语句”,即 TypeSafe 所称“composable intelligence”。

TypeSafe 称 Jev“不会幻觉”,但此“幻觉”指模型生成程序未定义、无法处理的输出。Jev 不自由生成字符串,所有输出及类型提前定义,若只允许“投诉”“退款”“咨询”,就不会创造第四类,即 type safety。官方注明“0% hallucination”并非测试统计,而是因 schema matching 被保证,直接记为 0%。
通常所说的幻觉,指模型一本正经编造事实。原因之一是语言模型学习预测下一词,训练数据不附真假标签,后续训练和评测还常奖励“猜答案”。OpenAI 去年研究指出,答错和回答“不知道”都不得分时,猜答案至少可能蒙对,模型因此更易在不确定时继续回答。危险的不只是“错”,而是模型不确定却输出看似确定的话。普通 LLM 内部虽有概率分布,但下游通常只拿到生成好的自然语言,51% 和 99% 把握都可能变成“答案是 A”。
Jev 想保留不确定性,输出结构化答案及概率,如“投诉 92%、退款 5%、咨询 3%”。若最高概率仅 45%,系统可升级给更强模型或人类。TypeSafe 称其为“epistemically honest probabilities”。Type safety 保证答案不超处理边界,calibration 告诉程序答案多值得相信:一个解决“能不能处理”,一个解决“要不要执行”。这提供了降低广义幻觉风险的思路,但校准不等于没有幻觉。OpenAI 研究提醒,模型可能每次答错却诚实说“0% 把握”,概率校准但答案全错,因此 calibration 并非幻觉率衡量指标。这也引发质疑:Jev 表现真有这么好?
更多推荐阅读

谷歌让AI“做梦”训练,破解自我改进算力难题
AI要学会自己改进自己,谷歌打算先让它做个“梦”。这场“梦”瞄准的是AI行业热议的RSI,即递归自我改进:让AI改进自身,改进后的系统再继续改进自己,一轮接一轮。但这个循环有一道坎:换一种做事方法究竟有没有用?如果每调整一次探索策略都要把整轮实验重跑一遍,AI变强的速度不好说,算力账单倒是先涨起来了。 谷歌研究团队在新论文《Dream-RSI》中给出思路:让AI先在“梦里”试。所谓“做梦”,就是...
2026-09-17
手机背面成AI硬件新战场,创业者扎堆涌入
录音卡、副屏、电子纸、AI 宠物……过去一年,AI 硬件创业者开始扎堆手机背面。 Plaud 的 AI 录音卡累计出货突破百万台。2026 年 6 月,Plaud 宣布 ARR 达到 1 亿美元、服务超过 200 万专业用户;截至 9 月,全球用户数已超过 250 万。做磁吸电子纸屏的阅星曈完成近 5000 万元 A 轮追加融资,顺为、经纬、博裕和小红书等老股东继续跟投;极稚科技称其无源墨水屏手...
2026-09-17
AI手机只会答题还不够,vivo想让它真正替你办事
AI能力更强,并不意味着手机用户体验更好。航班延误通知弹出后,AI能总结内容、回答晚点多久,但真要继续处理改签、酒店、会议等一连串任务,事情立刻复杂起来。它还未必记得你的习惯:愿不愿意坐凌晨航班、在不在意多花几百块、第二天会议能否迟到。想在手机上开发应用,还要考虑接口、MCP等问题。于是AI好像什么都会一点,但真遇到事,最后常还是得自己动手。 这解释了AI手机越来越明显的落差:模型能力上涨,Be...
2026-09-17
开口使唤AI干活,这款299元硬件真能让你当甲方?
想象一下,你正在赶PPT,突然想让AI把一张产品图改成海报。过去需要打开AI窗口、输入提示词、上传素材,再把结果复制回设计软件。现在有人想把这一整套操作压缩成一个动作:开口说话。为此,他们做了一款硬件——Vibe Key AI键盘麦,由优篮子Ulanzi与腾讯WorkBuddy联合推出,售价269至299元。它看起来像一个麦克风、三颗按键加一颗旋钮,更像给AI配的“指挥棒”:按一下,说句话,就能调...
2026-09-17
腾讯内测AI语音助手Chatterfly:语音即可成文
当行业都在把AI能力往输入法壳子里做增量,腾讯正在做一套独立的AI原生输入工具。腾讯正低调开启AI原生语音助手Chatterfly的内测,需内测码才可使用。现阶段开放macOS、Windows两大桌面客户端下载,移动端尚未上线,处于即将发布状态。 Chatterfly定位AI原生表达辅助工具,基础能力覆盖语音输入、全场景AI打字,同时提供场景化深度润色、AI指令执行;适配弱网、嘈杂、轻声等现实录...
2026-09-17
神秘模型Union Alpha首日狂烧20亿Token,实测性能直逼Astra
当地时间9月16日,OpenRouter上线匿名模型Union Alpha,称其为面向研究、编程和智能体工作流的多模态模型,具备“前沿级性能”。该模型未公布开发团队、参数规模、训练方法和基准测试成绩,以免费形式开放,供开发者盲测。 OpenRouter披露,Union Alpha上线首日处理Token约20亿,截至发稿前消耗总量已超1000亿。其定位仍为平台和提供方描述,尚无完整可复现的第三方测...
2026-09-17