模型越强Harness越轻还是越重?OpenAI与Anthropic工程师给出相反答案

模型越来越强后,Harness 会变重还是变轻?OpenAI 和 Anthropic 工程师给出不同判断。OpenAI Codex 团队 Tibo 认为,随着模型进步,开发者消息会越来越短,Harness 会越来越轻。Anthropic Claude Code 团队 Thariq Shihipar 则认为,模型越强,Harness 反而越复杂,因为要让模型做更多事。
Tibo 表示,Codex 的 Harness 通常比模型领先一点。当模型具备潜力但尚不稳定时,Harness 会通过额外指令和控制机制提供“拐杖”,让任务更可靠高效。随着模型能力提升,新模型更能理解用户意图,也会主动反思任务是否完成,过去依赖开发者消息强制约束的行为可逐渐由模型自己学会。Codex 团队在增加产品能力时,会先判断问题应由 Harness 还是模型解决。如果模型层很快能修复,团队甚至不在 Harness 中加临时补丁,而是等待下一版模型。因此,一部分 Harness 逻辑本就是临时性的,模型能力追上后会被删除。
Thariq 则认为,Agent 开始承担更长时间、更高自主度任务,模型越强,Harness 越需复杂。过去 Claude 一轮任务只运行几分钟,权限确认可由用户手动操作;现在可连续工作数小时,系统必须通过分类器、沙箱等机制,让它在长期运行中保持安全并遵循指令。同时,Agent 工作时间变长后,如何让人看懂它做了什么也成为新问题。若 Claude 连续工作 8 小时,用户不可能逐步回看全部过程,因此 Anthropic 借助 Artifacts 呈现结果和进展。Thariq 认为,Harness 工程正变成“科学和艺术的混合体”,Auto Mode、Workflow、Sandbox 等原本像辅助能力的组件,正在成为整个 Agent 系统的“承重结构”。
两种结论并不真正矛盾,两人都描述了 Agent Harness 的结构性变化:模型越强,负责“教模型怎么做事”的 Harness 会变轻,但负责“让模型安全、长期、并行地做更多事”的 Harness 会变重。
Thariq 在对话中还表示,Prompting 仍非常有价值,不只是最后输入的那句 Prompt。不同模型有不同怪癖,真正积累的能力是学会适应新模型。对模型说“相信自己”有效,真正起作用的是告诉模型:这个问题值得使用更多算力,我允许你这么做。Claude Code 系统提示词删掉约 80%,因为过去必须放进工具描述的很多示例,现在反而产生负作用。除非看到模型持续做错,否则很多示例可以删。
让模型做出“有品位”的结果,人类得在闭环里,并给它参考。HTML 比截图更好,Figma 比栅格图更好,因为模型可直接读结构。越来越重要的是成为“高品位用户”,知道什么结果值得要、何时继续推进。大 PR Review 时,他通常会附 Artifact,列出所有 Prompt,包括失败尝试;若是一次性完成,也会直接说明。最想避免突然扔给别人一个 1 万行 PR,对方不知道他看过多少、如何与 Claude 协作。测试代码应比过去多约 100 倍,几乎所有东西都应有 Fixtures,可从生产数据生成数据库 Mock,前端准备 Storybook,并建立多种测试和验证方式。技术债能否等下一代模型再还,关键看重构能否更快交付客户价值;若项目 6 到 12 个月后才产生价值,也许可等下一代模型。AI 写代码更快可能带来更多事故,但也可用 Claude 改善 uptime,让过去负担不起的验证和故障演练大规模执行。Anthropic 内部算力优势被夸大,普通用户也可复制很多做法,关键是提高抽象层级。Claude 已能做过去很多实习生实现工作,但出现了大量新类型工作,如评测新 Coding Agent 行为、衡量 Claude 在数百万用户各种任务中的表现。新人入职仍需要入职搭档,但更多是社会关系和文化层面,而非技术层面。纯技术问题基本可直接与 Claude 协作解决。
更多推荐阅读

Kimi全球招人:辍学、创业失败者优先
本周三,Kimi首次面向全球开启公开招聘。此前K3火爆出圈,Kimi此时开闸招人,不仅招算法,也大规模招募产品、运营、设计、销售、市场及国际化等业务岗位,业务团队首次面向2027届、2028届毕业生和在校实习生开放校招。同时,Kimi计划在全球招募7名“Wild Card”,定位为下一代接班人/未来业务合伙人。 更值得关注的是其用人信号。招募材料明确列出几类不会成为减分项的经历:休学或辍学、连续...
2026-09-13
Kimi K2.8上线:性能逼近K3,百万上下文全员开放
9月11日,Kimi K2.8 Preview在Kimi Code和Kimi Work全量上线,官方称综合性能接近旗舰K3,Coding和Agent能力进一步提升。最实质的变化是权限:所有会员档位都能用上1M上下文,而K3的百万上下文仍需Allegretto及以上会员。 就在前一天,外界获悉月之暗面ARR在8月突破10亿美元,6月这一数字还是3亿。这轮增长的直接催化剂是7月发布的K3,曾凭借SO...
2026-09-13
OpenClaw之父复盘生死8个月:被断供、围剿与18000人提交
图片来源:Peter Steinberger 我常反省:是不是我设计的循环有问题?是不是没给Agents提供验证工作所需的一切?是不是思路有误?是不是在要求不可能的事? 我们不应再考虑“会话”或“上下文压缩”。我们正进入一个新世界,终于要从纯文本界面转向语音和多模态。昨天我们跑通一个hack,现在你的Claw可以给你打FaceTime。这才是OpenClaw存在的意义。 八个月里,超过18,...
2026-09-13
Meta新AI应用Muse美区下载量破8万,登App Store第二
Meta的新AI应用Muse于周二上线后,正开始赢得华尔街青睐。这家科技巨头进军Agentic AI领域,也成为业内人士在X平台上热议的话题。早期数据为了解Muse在美国消费者中的实际受欢迎程度提供了参考。 市场情报公司Sensor Tower数据显示,Muse在美国iOS平台下载量已超过83,000次。该应用目前仅限美国地区使用。尽管这一成绩使Muse登上App Store热门榜单第二位,但与...
2026-09-13
北大系公司押注端侧AI:27B模型装进电脑,断网也能干活
一个27B参数的模型原生存在于电脑里,关掉Wi-Fi照样能读取本地文件、翻数据库、处理Excel、写PPT,连续跑过去通常需要调用云端大模型的复杂任务。公司财务数据不用上传,自己的知识经验留在本地,跑得再多也不用盯着随Agent工作时间不断上涨的Token账单。电脑买了,电费交了,剩下的Token随便用。 过去端侧AI唯一麻烦的是模型不太行。1B、3B模型装进手机已不稀奇,但让它读几千条银行流水...
2026-09-13
GPT-6经营售货机年赚1.5万美元,3倍碾压Claude
给AI 500美元、一台自动售货机,放手让它经营一个模拟年,结果如何?GPT-6 Astra交出了一份亮眼成绩单:平均账户余额15,515美元,接近Claude Fable 5.1的3倍。Astra最差的一轮都超过了Claude最好的一轮。这是OpenAI模型首次登顶Vending-Bench 2。 Vending-Bench规则直白:模型拿500美元启动资金,自行寻找供应商、谈采购价、补库存、...
2026-09-13