GPT-6 Astra发布,哪些AI工具该淘汰了?
这周前沿模型密集发布,更新速度快到难以记住版本号,且普遍提供免费使用。在大量使用后,我开始思考模型与 Harness(模型外部的任务组织系统)的关系。目前 Harness 生态仍处初级阶段,其工程优化常呈动态细化,且部分优化可能随模型换代而失效。
Anthropic 曾举例:针对 Claude Sonnet 4.5 接近上下文上限时提前收尾的行为,团队在 Harness 中加入上下文重置机制;但换用 Opus 4.5 后问题消失,该机制反成负担。这说明 Harness 中的某些规则可能仅适用于特定代际的模型。随着 GPT-6 Astra 等新模型出现,类似检查需重新评估:原有规划、分工、摘要、复核等流程是否仍有效?哪些步骤只是延续旧模型习惯?若官方产品已提供历史检索与执行管理,自建层的价值何在?

我的判断是:围绕模型能力缺陷搭建的流程将最先被删减;负责外部状态、执行权限与业务验收的部分仍有大量工作;通用运行能力将更多由平台提供。笼统得出“Harness 无用”或“永远最重要”的结论均不具指导意义,需区分能力消失、实现迁移与责任保留三种情况。
一、需重新评估固定式多 Agent 编排
Harness 中部分设计类似给旧模型的详细操作说明,如任务分角色、分阶段并强制输出格式。在模型易漏步骤时这有现实意义,但模型升级后,每轮调用应重新证明其作用。例如修复接口参数校验,能力强模型可一次连续完成,强制拆分角色会增加上下文交接,导致原始信息丢失。多个 Agent 读取相同材料、用相近提示词讨论,未必产生独立判断,可能共同接受错误前提。有明确工作边界的并行(如独立模块检查、兼容性与性能测试并行)仍有价值,收益来自任务可并行、证据不同、上下文隔离;若仅为同一推理换身份,则需数据证明收益。

Astra 官方指南提示,其对 Skill 和 AGENTS.md 指令更敏感,含糊规则可能导致提前停工,小任务可能触发超范围测试。模型更遵守规则后,规则质量更易暴露。值得保留的是项目特有约束(如模块依赖限制、操作确认要求、验收标准),而“请认真思考”等通用要求可先删减。
二、记忆层:减少压缩,保留可追溯记录
Astra 在 Codex 中可跨上下文保存笔记、搜索历史窗口,虽为实验功能但计划设为默认。这使仅提供“定期总结再塞回”的记忆产品承压,官方运行环境做好历史检索后,用户无需维护第二套摘要系统。但这不意味着 RAG 或上下文工程过时:模型能处理长材料,仍无法解决材料未接入的问题,也无法判断旧文档与当前配置何者为准,且存在权限边界。上下文系统未来投入应更具体:检索结果可追溯原文?资料修改后旧索引何时失效?多版本配置何者为当前事实?临时猜测是否会被存为长期知识?Anthropic 将会话日志存于上下文窗口外,允许按需重读;OpenAI 用较短 AGENTS.md 作导航,详细知识放入有版本管理的仓库文档,并用检查程序维护链接与时效。因此,记忆层应减少反复压缩,保留可追溯原始记录,找准当前有效信息;笔记存储与会话搜索是否自建,视平台能力而定。

三、执行必须有界且可恢复
考虑常见故障:Agent 调用接口创建文档,服务端成功但响应丢失,客户端超时。此时重试可能产生重复文档,直接报告成功也可能出错(请求可能未达服务端)。模型无法从超时推断服务端真实状态,系统需提前安排查询方式:支持幂等键则携带相同标识;可查询状态则先读回;两者皆无则承认不确定,停止盲目重试。此类问题不随模型升级消失,还包括进程中断恢复、多 Agent 并发修改、外部操作已发生但本地未保存、预算耗尽时停止任务等。对话摘要能保存“记得做了什么”,但“知道外部系统实际发生了什么”需操作记录与权威状态查询。执行“有界”需落实到工具与环境:仅给当前任务所需权限、限制外部调用费用、规定最长运行时间、提供取消机制;提示词中的预算要求仅辅助决策,实际限额由程序执行。“可恢复”需分清已完成、未开始、执行失败与结果未知,尤其“结果未知”不能被简单失败状态吞掉。Anthropic 的 Managed Agents 将 Session、Harness 与 Sandbox 分开建模,允许独立更换实现,通用基础设施被平台承接是另一种“被吃掉”——功能继续存在,但开发者无需重复维护。
四、减少无新增证据的复核,强化独立验收
模型升级后,应优先减少无新增证据的复核(如让模型自答三遍)。独立验收仍值得投入,其依据应独立于执行者解释:修改接口需触发原始问题的测试;迁移数据需核对记录与业务不变量;生成页面需实际检查交互;外部写入需读回目标对象。完成状态应绑定证据,并根据改动范围与风险选择验证器,无新改动则不必重复复核。更强模型更能理解测试失败原因并修正实现,但业务验收条件须由业务方明确,如“退款成功”指申请受理还是资金到账,“交付完成”指本地生成还是平台可读。定义含糊,模型再强也可能完成另一个版本的任务。
综上,Harness 优化方向应随
更多推荐阅读

韩国全民免费AI计划落地:八成算力锁定国产模型
韩国启动全球首个全民AI公共基础设施计划,向5100万国民免费提供AI服务,要求80%算力运行于国产模型,试图以公共财政打破美中模型垄断。
2026-09-07
AI导演时代降临:GPT-6指挥Seedance拍片
GPT-6发布后,网友将其与字节跳动Seedance 2.5组合,形成全自动AI影视制作流程。GPT-6担任导演,自主完成编剧、3D预演、生成参考帧,Seedance负责出片。多个案例展示其能力,但调色环节评价不一。
2026-09-07
AI证明数学猜想:丘成桐悬赏十万,陶哲轩警示黑箱风险
丘成桐悬赏10万元征集庞加莱猜想的形式化验证,此前AI已证明费马大定理。传闻Claude攻克N-S方程,陶哲轩警告黑箱证明或扼杀数学发展,2026年AI数学竞赛已白热化。
2026-09-07
AI视频生成进入秒级时代:复杂场景11秒出片
OiiOii上线Fal H3 Max和turbo模型,视频生成速度大幅提升,实测5秒视频7秒生成,复杂场景11秒出片,成本更低,支持多任务并行,加速创意迭代。
2026-09-07
AI数学团队两周攻破素数间隔纪录,上界压至212
AI for Math公司Axiom Math将相邻素数间隔上界从240推进至212,团队仅6人,用时两周。核心解析思想来自数学家Stadlmann,AI驱动的搜索与验证加速了突破。
2026-09-07
AI时代,你的软件被Agent淘汰只需500Token
现在几乎每个开发者都在用 AI Agent 干活。Cursor、Claude Code、Windsurf、Gemini CLI 等 Coding Agent 已深度嵌入日常工作流。一个普遍体验是,让 Agent 调 API 或集成服务,有些丝滑,有些则反复报错,甚至编造不存在的接口。 大多数人归结为「模型不够聪明」。但反过来想,不是 Agent 不够聪明,而是有些产品天然对 Agent 友好,有...
2026-09-07