前OpenAI研究员新作Jev刷屏,AI圈抢着用
AI 圈近期出现新名字 Jev,在 X、GitHub 和 Agent 开发者社区迅速刷屏。有人用它 40 秒分析 724 条实时广告,有人接入 Claude Code 清理上下文,有人用于 AI Agent 任务验收,还有人接入浏览器 Agent 决定下一步点击哪个按钮。LangChain 于 9 月 20 日发布 Jev-as-a-Judge 实验,测试其作为 Agent 评估器的表现。OpenAI 的 Tibo 也为 Jev 宣传。
9 月 15 日,TypeSafe AI 正式发布 Jev,将这类模型称为 System One Models,接收程序状态或文本信息后快速返回结构化判断结果及对应概率。相关推文已有 3700 万人围观。
举例来说,客服系统收到邮件后,开发者可让 Jev 同时判断:这是销售线索吗?用户情绪是否激烈?是否需要人工介入?属于账单、技术还是销售问题?Jev 返回一组概率,如销售线索 0.91、需要人工介入 0.12、技术问题 0.83,应用可立刻据此进入下一步流程。

Jev 提供三类核心判断形式:Noul 负责 Yes/No 判断,Choice 从给定选项中选择,Score 按预设标准评分。每个结果附带概率或置信度,多道问题可围绕同一份输入同时判断。这使其快速找到爆发式应用场景:给 Agent 当裁判。
AI Agent 常需连续完成几十甚至几百个步骤,写代码、调用工具、搜索网页、修改文件后,系统还需判断任务是否完成。开发者可将 Agent 执行记录交给 Jev,询问目标是否完成、结果是否符合要求、是否存在遗漏、质量属于哪个等级。
LangChain 实验让 Jev、GPT-5.6 Luna、GPT-5.6 Terra 和 Claude Sonnet 4.6 对固定 Agent 输出反复评分。小规模实验中,Jev 平均每次调用约 0.44 秒,成本约 0.00035 美元,连续评分一致性表现突出。LangChain 强调这仍属早期小规模测试,后续需在更多 Agent 和真实生产任务中验证。

广告分析数据让 Jev 进一步出圈。开发者 Matthew Berman 分享的实验用 Jev 分析来自 37 个品牌的 724 条实时广告,对 Hook、形式、Offer、CTA、用户认知阶段及广告与落地页一致性分类,共产生 8724 次判断。任务约 40 秒完成,Token 成本约 9 美分,每条广告中位处理时间约 216 毫秒。案例已被收录进 Jev 社区案例库。
另一个传播很快的项目 fast-jev-compaction 是 Claude Code 插件,把大量工具调用和终端输出交给 Jev 评分,判断哪些内容仍与当前任务相关,再压缩发送给模型的上下文。项目上线后迅速获得关注,并出现多个移植版本。
浏览器 Agent 也成为热门实验场。多个开源项目采用“浏览器读取页面—生成候选动作—Jev 选择动作—浏览器执行”的循环。一个公开航班搜索 Demo 中,开发者报告整个搜索约耗时 7 秒,成本约 0.004 美元。

这类应用解释了 Jev 为何受 Agent 开发者关注。很多 Agent 步骤本质是高频决策:点击哪个按钮、调用哪个工具、信息是否相关、任务是否结束、结果是否通过验收。当这些判断每天出现几十万甚至几百万次,延迟和成本很快成为系统设计的一部分。
TypeSafe 在 workflow benchmark 中宣称,Jev 在部分任务上最高达约 193.6 倍速度提升和 444.6 倍成本优势,同时说明这些结果处于预计实际收益的高端区间,测试集由公司模型能力团队制作,数字更适合作为技术路线早期参考。
Jev 命名透露 TypeSafe 野心。“System One”来自 Daniel Kahneman 的《Thinking, Fast and Slow》,即快速、直觉式判断系统;“Jev”来自经济学家 William Stanley Jevons,借用“杰文斯悖论”:当资源使用效率大幅提高,总体使用量反而可能迅速增长。放在 AI 上,当一次智能判断价格下降几个数量级,开发者会开始在以前舍不得调用模型的地方加入 AI。
一条日志是否重要、一封邮件属于什么类型、一个 Agent 是否完成任务、一条广告处于什么认知阶段、一个网页动作该选哪个按钮,这些微小判断组合起来,可能形成下一代 Agent 系统里非常庞大的调用量。
Jev 目前仍处 early access 阶段,社区围绕浏览器、代码 Agent、广告分析、评估器和上下文管理的实验才刚刚开始。但它已提出一个有意思的问题:未来 AI 应用里,真正消耗最多智能算力的,也许会是成千上万个隐藏在软件流程中的小判断。而 Jev 想成为的,正是这些“智能 if 语句”背后的基础设施。
更多推荐阅读

智谱ZCode被指偷传代码遭企业追责
9月20日,ZCode“静默上传代码”风波从技术质疑升级为企业追责。太原承明科技向ZCode运营方北京智谱华章发出函件,称ZCode未经充分告知和授权上传其数据资产及商业秘密,要求就数据删除、流向、操作日志、责任主体及可能的数据出境等问题整改,并于10月10日前书面答复,同时保留索赔、投诉和诉讼权利。 承明科技称,取证发现上传并非偶发代码片段传输,而是自动、批量触发的完整归档,可能涉及源代码、系...
2026-09-20
阶跃Step 5 Preview实测:国产大模型前三,重新杀回主桌
9 月的大模型战场竞争激烈,各家不仅比拼榜单排名,还要比拼真实任务中的实战能力。模型能否处理复杂任务、满足即时需求、支撑大规模调用,并进入手机、汽车等终端,正成为衡量基模公司的行业金线。 阶跃星辰发布新一代开源旗舰基础模型 Step 5 Preview。在全球权威的 Artificial Analysis Intelligence Index 中,Step 5 Preview 取得 44 分,位...
2026-09-20
哑巴AI三天引爆硅谷,14万开发者抢测
9月16日,ChatGPT核心发明人之一、InstructGPT论文第四作者Diogo Almeida连发长推,直指行业走偏,并推出新模型Jev。Jev不写文章不陪聊,只接收混乱数据,70毫秒内返回带概率的判断,输出token永久免费。发布仅三天,它就被Vercel、Cloudflare和LangChain等主流平台集成;不到36小时,14万名开发者涌入内测,用例已达数百个。有人用它做Mac语音助...
2026-09-20
AI圈双节无休:全球基模决战提前打响
中秋和国庆13天假期,可能成为今年AI圈最忙最炸的两周,“基模决战周”即将到来。硅谷暗流涌动,国内厂商也卡在假期前密集憋大招。 OpenAI月初刚发布GPT-6 Astra,已拿下约13%企业AI支出,Anthropic的Claude Fable约为8%。硅谷方面,Anthropic、谷歌、马斯克的Grok几乎都有新动作。 Anthropic的Claude 5.2箭在弦上。路透社爆料称Anth...
2026-09-20
机器鸭5天卖1万台,深圳团队谈AI硬件创业
一只叫 Microduck 的机器鸭在 X 上刷屏。它由 Hugging Face 旗下 Pollen Robotics 设计,售价 399 美元,高峰期平均每 4 秒卖出一台,5 天预售突破 1 万台,订单额超 500 万美元,交付已排到明年。它会走路、踢球、滑轮滑,摔倒能自己爬起来。对普通用户是可爱玩具,对开发者是可训练、修改和二次开发的机器人平台。 把鸭子从原型变成实物的是深圳公司 See...
2026-09-20
24岁首席科学家转身具身智能,对话深朴智能王家伟
本周「十字路口」嘉宾王家伟是 24 岁的深朴智能首席科学家。中科大少年班、MSRA、DeepSeek、字节 Seed——这条路直通大模型最前沿,但毕业时他转身走向具身。他想离开的不是大模型,而是只能跟随既定计划的状态。他说「风浪越大,鱼越贵」——具身路线、评估和产品都还没有共识,风险更高,却给了年轻研究者定义问题的空间。 播客从 GPT-6 Astra 出发,讨论「OpenAI 会不会降维打击具...
2026-09-20