前OpenAI研究员:Jev出现前AI世界是悲剧

前OpenAI研究员:Jev出现前AI世界是悲剧

AI 资讯 来源:新闻/公众号 发布时间:2026-09-27 更新于 2026-09-27 预计阅读 7 分钟

“它会逐渐退到软件背景中,像数据库、正则表达式或其他基础设施一样,成为开发者随手调用的普通能力。”这是 TypeSafe CEO、Jev 创始人 Diogo Almeida 对 AI 的设想:当智能真正融入软件,用户甚至不必意识到它的存在。但怎样才能让开发者放心地把判断交给 AI,而不用守在旁边反复检查?

几个月前,在 AI Engineer 大会的演讲中,这位曾参与 OpenAI InstructGPT 工作的研究者就提出,“下一个时代并不是 Claude Code 时代”。在他看来,Claude Code 与 Codex 本质上仍属于同一个阶段——AI 的主要角色仍然是围绕人提供辅助。他关心的是,为什么 AI 如此聪明,能解决数学界的千禧年难题,却连最基础的活都无法实现自动化工作?

9 月 22 日,做客 Latent Space 播客接受采访时,Diogo 再次谈起这份不满,措辞更加直接:“在我看来,Jev 出现之前的 AI 世界,简直是个悲剧。”在他看来,问题在于:强大的“智能引擎”已经有了,把它接进实际业务流程的接口却仍然欠缺。

这一次,他带来了自己的答案——Jev。通过面向校准决策的强化学习(RLCD),团队希望让模型输出可供代码直接使用的选择、评分和概率,让开发者能够依据不确定性设置阈值,决定何时执行、何时交给人处理。

从参与训练听懂人类指令的模型,到尝试让代码直接调用智能,Diogo 为什么要重新选择训练目标?他又准备如何让 AI 成为像数据库一样普通的软件能力?这场两小时的访谈讲述了他的判断与尝试。

太长不看版:

Swyx:对于那些可能不太了解情况或者只想得到确切答案的人来说,Jev 到底是什么?

Codex和Claude Code都跑偏了,前OpenAI研究员称Jev出现前AI世界是个悲剧

Diogo Almeida:目前最准确的称呼是 System 1 模型,它的能力范围远远超出决策本身。这类模型的目标,在于让代码成为模型输出的直接使用者。

Swyx:你对 RLHF 的一个核心看法是:模型的回答会向用户想听的内容,而不是反映它对一件事真正的内部置信度。能具体谈谈吗?

Diogo Almeida:几乎没人注意到 RLHF 的缺点,特别是“模式坍缩”(mode dropping)。RLHF 的模式坍缩会让模型偏向生成更安全、更常见的答案,而牺牲概率分布的真实校准,这既掩盖了长文本中的错误累积,也解释了为什么文本模型不擅长决策。

Swyx:RLCD 与 RLHF 的核心区别是什么?

Diogo Almeida:区别首先在于优化目标:RLHF 侧重让模型遵循人的指令、给出获得认可的回答,RLCD 则希望模型成为软件能够可靠调用的能力。

Swyx:为什么 Jev 不把拒答机制直接放进模型底层?

Diogo Almeida:我不反对安全本身,但我认为不应把特定价值判断直接写进通用模型底层能力,而应像数据库一样划清技术能力与具体使用责任的边界。

Codex和Claude Code都跑偏了,前OpenAI研究员称Jev出现前AI世界是个悲剧

Swyx:你所说的可靠性是什么?开发者能否相信同一个版本的行为保持稳定?

Diogo Almeida:我更重视稳健性:问题含义没变,就不该因为加入无关字符而大幅改变判断,而不只是追求相同输入得到相同输出。已经部署的模型,我们不会悄悄修改,因为 API 是别人程序里的依赖。但我们会快速发布新版本,目前还不能承诺永久维护每个旧版本。

Swyx:不依赖公开榜单,你们怎样判断模型是否真正做到了更高的性价比?

Diogo Almeida:我们会通过内部评测比较成本和能力,追求同等成本下更强、同等能力下更便宜。我不反对评测,反对的是围绕榜单优化,让分数脱离真实价值。开发者最终还是要把模型放进自己的工作流,测量实际表现,不能只看价格、速度或一个总分。

Swyx:开发者应该怎样组织任务,才能更可靠地使用 Jev?

Diogo Almeida:我建议把复杂任务拆成最小、可以独立判断的语义单元,用结构化输入提供必要信息,再由代码控制最终行为。Choice 对应选择分支,Noul 对应条件判断,Score 对应评分、排序和筛选。每一步都可以单独评估、调整阈值;能力不足时,就转交人工或暂不部署。

Swyx:对企业开发者来说,Jev 有哪些值得尝试的应用方向?

Codex和Claude Code都跑偏了,前OpenAI研究员称Jev出现前AI世界是个悲剧

Diogo Almeida:我们梳理了四类:分析因处理成本太高而闲置的“暗数据”;为实时流程提供快速判断;检查其他模型的调用和输出;把智能判断嵌入软件核心逻辑。我尤其看好暗数据分析和编程 Agent,但具体如何组合模型,仍要看它能否降低成本、解决原本解决不了的问题。

Swyx:面对前沿 AI 的风险,放慢发展速度是唯一选择吗?

Diogo Almeida:我认为,这种讨论往往默认大家必须沿着现有 RLVR 路线继续加大投入,但研究目标和技术路线都可以重新选择。为了提升表现而给模型多大行动空间,本身就是设计决定,不该被当作不可避免的前提。我更希望探索其他方向,让已有智能可靠地进入软件,自动化实际工作。

Swyx:如果研究者在前沿实验室得不到资源,你会建议他们出来创业吗?

Diogo Almeida:要看为什么离开。如果只是想自由尝试课题,现有实验室可能仍然最合适;如果找到了值得长期投入的新任务,我会支持创业。我不认为漂亮的研究履历会自动创造价值,也不看好拿到资金后重复已有工作的做法。先明确自己的核心目标,再围绕真正值得解决的问题展开研究。

Jev 发布的第一周,创始人的情绪糟糕透了

Swyx:欢迎来到录音室。就在本周,我的好朋友 Diogo 发布了 Jev,它几乎占领了社交平台的热点话题。此时此刻,你感觉怎么样?

Diogo Almeida:情绪上来说,从来没有这么糟过。我现在简直像一具疲惫不堪

标签: AI 资讯 AI

更多推荐阅读

模型不够强,灵巧手才要卷性能?源升智能杨思成谈机器人操作

模型不够强,灵巧手才要卷性能?源升智能杨思成谈机器人操作

灵巧操作的最高境界,是“无剑胜有剑”。在源升智能创始人杨思成看来,灵巧手之于机器人操作能力,就像兵刃之于剑术,模型越强,就越不依赖末端执行工具;反之,模型能力不够强时,就需要灵巧手加持才能更好完成任务。 杨思成在清华时期便专门研究灵巧操作,2018年加入腾讯Robotics X实验室,担任灵巧手项目总负责人。2024年,他成立源升智能,开启灵巧手创业。他认为,现在行业都在打造“神兵利器”——更多...

2026-09-27
中国最强AI芯片发布,平头哥再开源软件栈

中国最强AI芯片发布,平头哥再开源软件栈

9月22日云栖大会上,阿里巴巴CEO吴泳铭介绍新一代真武V900,称其是目前中国算力性能最强的AI芯片,性能达M890的3倍。但客户换用真武,还需确认原有代码、工具和开发经验能否迁移。芯片之外,软件生态同样决定客户选择。 9月23日,平头哥公布AI软件栈T-Head SAIL最新开源进展,扩大框架适配、加速库、工具链和通信库等开放范围。平头哥将AI芯片比作发动机,软件栈则是“变速箱+传动系统+驾...

2026-09-27
华为大模型双子星创业,要做物理世界的Scaling Law

华为大模型双子星创业,要做物理世界的Scaling Law

数亿元资金,投向了一场物理世界的基模实验。Physical AI创业公司息壤开物宣布,已连续完成数亿元种子轮及天使轮融资,由敦鸿资产领投,华控基金、三花控股、银杏谷资本、泽然资本、本坚基金、天使基石、标朴投资等跟投,估值达5亿美金。 公司创始人、CEO李寅,前华为云大模型CTO,华为大模型0-1阶段核心成员;联合创始人张含望教授,前华为多模态首席科学家。二人联手,瞄准具身智能尚未解决的底层难题:...

2026-09-27
Opus 5.5与GPT-6被指偷师中国AI团队

Opus 5.5与GPT-6被指偷师中国AI团队

所谓“天下文章一大抄”。刚发布的Opus 5.5和GPT-6 Luna,身上满是姚顺雨和梁文锋的影子。两家公司预训练已做到极致,为提升智能、降低算力成本,都选择开辟新战场:Opus 5.5对上下文动手,GPT-6 Luna对缓存动手。 **阿莫迪偷师姚顺雨** 在Artificial Analysis智能指数中,Claude Opus 5.5在max档位下平均每题输出11.9万token,其中...

2026-09-27
OpenAI Codex负责人揭秘:从内部工具到顶流,终极目标不只是写代码

OpenAI Codex负责人揭秘:从内部工具到顶流,终极目标不只是写代码

过去两年,AI编程最明显的变化,不是“代码写得更快”,而是软件开发本身正在被重新定义。从只能补全几行代码的Copilot,到今天能读懂代码库、调用工具、执行测试、提交修改,甚至持续运行数小时乃至数天的Coding Agent,模型正从“辅助工程师写代码”进入软件工程的完整生命周期。真正变化的已不只是效率,而是人和代码之间的关系:当正确性检查、安全审查、依赖升级、重构乃至部分架构工作逐渐自动化,人类...

2026-09-27
蚂蚁清华开源9B模型Realtime-Venus:AI边聊边办事

蚂蚁清华开源9B模型Realtime-Venus:AI边聊边办事

AI实时交互存在一个常见难点:查资料、跑任务需要时间,用户却常在此期间继续追问或补充信息。如何边处理任务边听懂并回应用户新需求,是对AI助手的一大考验。近期,TML-Interaction-Small、SeedRealtime及Qwen-Omni-Realtime相继推出闭源方案。蚂蚁AI安全实验室与清华大学人机交互实验室联合发布Realtime-Venus,通过开放模型权重与代码,将全双工交互与...

2026-09-27
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部