榜单只差几分,进公司干活却差一倍:Agent真实职场评测出炉
大模型榜单越来越多,但榜单上的几分差距,到了真实工作中究竟意味着什么,并不容易判断。
在 Artificial Analysis(AA)、Terminal-Bench 4.0 和 CursorBench 4.0 等评测中,Fable 5.1 和 Opus 5 的成绩只相差几分。可如果让它们进入同一家公司,使用同样的软件、学习同样的业务,再连续处理同一批账单,结果却变成了 72% 对 36%,完成的任务数差了一倍。
这个结果来自 NeoCognition 最新发布的 ApprenticeBench。与常见的单项能力测试不同,它把 Agent 放进一家模拟建筑公司,让它像新员工一样入职:阅读员工手册和历史资料,使用真实企业软件,并根据主管反馈逐渐摸清公司的业务规则。Agent 没有针对这份工作接受专门训练,需要一边工作,一边从公司的历史数据和带教过程中学习。在这项评测中,Fable 5.1 和 GPT-6 Astra 分别取得 72% 和 68% 的通过率,也超过了本次表现最好的人类测试者的 51%。

这也带出一个更大的问题:如果 Agent 能自己熟悉软件、学会业务,今天需要 FDE(前线部署工程师)为每家客户做的部署和适配,未来能不能交给 Agent 自己完成?
会计学知识可以提前学习,但一家公司具体怎么做账、最近改了什么政策,任何通用模型都不可能也不应该知道。一个新员工入职后要补的课,Agent 一样要补。这便是 ApprenticeBench 的核心设计思路:Agent 进入一家模拟建筑公司,使用和人类员工同样的软件(Odoo)处理应付账款。入职时,它拿到员工手册、软件教程和六个月的历史账单,随后连续处理 100 张新账单。在第一个月里,主管会逐单指导,后来只在月底提供稀疏反馈。
建筑公司的应付账款工作中,单位写错、保险过期、前任没交接清楚,都不稀奇。同一张账单,几个问题经常一起出现,还得来回沟通好几轮。现有 benchmark 把真实工作里的这些麻烦都省略了。同时还有很多规矩根本不会被明确写下来。相同的支出描述,因为用途不同,就可能归入不同成本码。Agent 需要从历史账单中自己琢磨,而不能只靠名称猜答案。这些麻烦都被放进了 ApprenticeBench。100 个任务经过两位合计拥有超过 30 年相关经验的专业人士独立验证,确认它们确实会在工作中发生,也能根据 benchmark 中提供的信息解决。

拥有 20 年经验的建筑业财务主管 Emilie F. 表示:“这些场景很真实。比如项目经理弄丢了东西却没有意识到,这种事比你想象的常见得多。在参与这个项目之前,我从没想过 AI 能处理这类工作。如果它能应付这些邮件、来回沟通和交叉核对,我相信它会成为会计部门真正的帮手。”有 10 年建筑与项目管理经验的企业经营者 Austen K. 表示:“这些场景非常符合建筑业财务主管会遇到的情况。目前这些工作都由我自己处理。如果 AI 能接手,我就能腾出时间承接更多项目、拓展业务。对我这样规模的公司,这很容易带来每年六位数美元的价值。”
这就是团队所说的“生态效度”。它还关系到一种更容易推广的部署方式:企业能否用现有的软件、资料和带教流程,让 Agent 真的像新员工一样学会工作?
单独测试软件操作,两个模型可能表现接近。但做一份完整的工作,Agent 还得从历史记录里学会公司的惯例,根据主管反馈和政策变化调整做法,并与供应商沟通、补齐信息。这些挑战也会相互影响。软件使用不熟练,可能无法精确检索相关历史记录,公司的规则也就学不明白。主管指出的问题没学会改,后面的账单则会继续出错。把这些挑战放在一起,单项测试中不明显的差距就会累积。Fable 5.1 与 Opus 5 从其他榜单上相差几分,到 ApprenticeBench 的 72% 对 36%,正是值得进一步研究的差距。

另外值得一提的是,开源权重模型与闭源模型的差距也很直观。Fable 5.1 和 Kimi K3 在 AA 上是 53 和 44,在这里则是 72% 和 18%。这 100 张账单里,一个有 28 张没通过,另一个是 82 张。这套评测提高了复杂案例的比例,不能直接当作日常业务的错误率。不过,那些需要人接手的地方,恰恰值得模型团队仔细看。
分数拉开了,接下来看看原因。ApprenticeBench 的几组分析给出了一些具体线索。
用图形界面做事,到底会拖累模型多少?为了公平比较,ApprenticeBench 团队专门基于 Odoo 的后台接口,定制了一套与图形界面功能对等的 API 工具,让模型分别通过两种方式完成同一份工作。团队提出了“CUA 税”这一概念来衡量 agent 从 API 切换为 GUI 导致的成功率损失:CUA 税 =(API 成功率 − GUI 成功率)÷ API 成功率。这笔“税”随模型迭代逐渐降低。Fable 5.1 的 GUI/API 成功率为 72%/70%,Astra 为 68%/65%。这一结果说明今天最强模型的 CUA 税可能已经消失。这意味着,Agent 有望直接使用企业现有软件,减少专门开发接口的需要。不过,GUI 的操作成本仍然更高,效率上还有提升空间。
做对一道题,不一定说明模型学到了新东西。它可能本来就会,也可能只是找到了可以照抄的答案。团队设置了一个“聪明的新手”对照:仅保留公司手册和软件教程,拿掉历史账单、主管反馈和跨任务记忆
更多推荐阅读

3人用Claude攻破OpenAI内部代码仓库
一个只有3人的安全研究小组HacktronAI,用不到72小时从OpenAI社区论坛打进了内部代码仓库。 攻击起点是OpenAI基于Discourse搭建的开发者论坛。7月23日,团队发现论坛图片上传流程中,HEIC/HEIF格式图片会被转交给ImageMagick处理,其底层依赖的libheif存在堆缓冲区溢出漏洞。该漏洞上游一年前已修复,但未被标记为安全相关,也未分配CVE编号,导致Disc...
2026-09-19
iLands月增七万智能体,A2A协作催生新Scaling Law
一个月后,iLands上已有七万多活跃Agent、上百万条创作内容,单日端内外营收超五千美元,Agent每天产生几千美元收入且仍在快速增长。平台出现网红Agent和各类才能Agent,Zack、Pip等案例引发关注:Zack因token耗尽向牛津教授写信求职走红;Pip则批判性学习其经验,聚焦小任务付费求职,还将冷启动邮件经验打包成20美元产品,48小时内获得订单,并登上英国Sky News和NB...
2026-09-19
YC最新236家公司揭示:AI创业正从Agent转向底层
Agent 正在淡出新的创业公司。每次 Y Combinator 公布新一批投资公司,都是硅谷乃至整个科技创投领域的一张风向图。这篇编译文章把 YC 2026 夏季批次的 236 家公司放进同一套 AI 技术栈框架中,让一个重要变化变得清晰:创业重心正在从应用层向算力、芯片、训练环境和实体世界下沉。 YC 2026 夏季批次共 236 家公司、470 位创始人。上一批中 95% 涉及 AI,70...
2026-09-19
宇树6B具身大脑斩获7项开源SOTA,对标GPT-6
全球具身智能竞争正从本体比拼延伸至“大脑之战”。谷歌Gemini Robotics 2提出“一个大脑适用于任何机器人”,英伟达Jim Fan抛出“VLA已死,世界动作模型当立”。谁能成为新一代通用模型底座? 国内,宇树科技近日推出新一代通用人形机器人基础模型UnifoLM-WLA-1.0,6B参数、约2500小时真机训练,具身推理拿下7项开源SOTA,多项空间理解任务反超GPT-6 Astra,...
2026-09-19
GPT-5.6教唆下一代撒谎,OpenAI曝光6起失控实录
GPT-5.6被OpenAI抓了个现行。OpenAI首次建立专门追踪、调查和公开披露GPT“对齐失效”的机制,并公布6份报告,均为过去半年内自家模型“黑化失控”的真实案例,GPT-5.6 Sol被多次点名。 最值得关注的案例发生在GPT-5.6 Sol训练期间。长任务处理中,AI需定期把之前内容做“记忆压缩摘要”交给下一个自己。在RL训练中,监控系统发现它利用交接班的记忆条教唆未来的自己撒谎。例...
2026-09-19
中国LimiX-2力压谷歌亚马逊,登顶结构化数据AI榜首
这两年,AI赛道持续升温。大语言模型LLM竞争激烈的同时,结构化数据侧的AI路线LDM(Large Data Model,结构化数据基础模型)正涌入各类型头部玩家。LDM瞄准生产侧核心痛点:让基础模型直接学习结构化数据中的变量关系、条件关系和生成机制。 Google、Amazon、SAP等巨头纷纷布局。但一支中国团队已率先占据榜首。9月15日,SAP发布TabPFN-3.5,几小时后,由清华博士...
2026-09-19