Opus 5.5干一半就停?官方揭秘:进度汇报被误当交差
Opus 5.5发布后,不少开发者发现模型能力变强了,却总在任务中途停下,不催不动。Anthropic官方指南点名了这种“半路溜号”:无人值守的Agent汇报完进度就停住,API信号是end_turn,而沿用旧逻辑的程序只认“不再调用工具=任务完成”,一份进度汇报被误当成交差。官方明确:纯文本回合结束只能视为汇报,不能当作完成凭证。
官方将半路停工归为四类:纸上谈兵,宣布下一步却不调用工具;过分礼貌,停下来等用户回复;假装请示,列出不影响继续执行的决策项;汇报强迫症,做一小阶段就总结。讽刺的是,“沟通更主动、总结更清楚”正是Opus 5.5的宣传卖点,放进旧程序却成了停工诱因。

官方给出三招:一是任务清单,把大任务拆细,回合结束若清单未完成且无阻塞说明,应用自动发消息点名续跑;二是铁面验收员,事先定好完成标准,每回合交给更小的模型对照检查,未达标就返工;三是硬刹车,同一任务自动续跑两三次仍卡住,强制交给人复查,避免空烧API额度。提示词也要两头堵:既说明不想要上述四种停法,也讲清何时才准停。
从Opus 5切到5.5有四处API改动,不改会返回400错误:thinking不能关闭,要么不传要么设为adaptive;tool_choice不能强制调用工具,建议用auto配合严格工具调用;thinking块绑定模型和上下文,2026年8月31日后创建的账户中途改提示词或历史消息再回放旧thinking块会报错;旧版电脑操作工具下线,需换成computer_toolset_20260801。

还有不报错的暗坑:进度文字被挪进默认不显示的thinking块,界面只显示正文会以为卡死,需把display设为updates或summarized;max_tokens管思考加正文总量,旧上限可能不够导致截断;思考内容不返回也按输出token计费。读结果要分清思考和正文,来回调用工具时思考记录须原封不动传回。用Claude Managed Agents的只需改模型名。
思考关不掉后,effort成为调控成本的唯一旋钮,支持low到max五档。官方称medium档可追平甚至超越Opus 5的high档,但同档位下Opus 5.5每回合思考量更大,旧项目high档直接搬来会导致回合变长、token狂飙。建议从medium起步,按数据再上调,想少琢磨直接降档比提示词喊“别想太多”更管用。

前端页面方面,不给明确设计方向容易产出千篇一律的AI风。写“避免通用AI感”只会换一套模板,有效办法是拉黑名单:不要奶油色或灰白背景、标题斜体强调词、01/02章节编号、等宽字体标签、胶囊形按钮。模型能听懂具体的“不要什么”,听不懂抽象的“要好看一点”。
模型一路狂奔,很多应用脚手架还停在上一代。Agent能否干完活,模型能力只占一半,另一半看你怎么定义“完成”、保存上下文、分配推理预算。下次Agent干到一半就溜,先回头翻翻自己写的那段循环。
更多推荐阅读

豆包App上线“出行用豆包”超级入口
《读佳》获知,国庆前夕,豆包App正式上线出行超级入口“出行用豆包”,位于App聊天框上方,集合打车、地图导航、高铁机票查询、订酒店民宿和吃喝玩乐推荐为一体。 目前看,“出行用豆包”是一个AI原生的一站式出行和本地生活面板。 点击进入“出行用豆包”面板之后,整套能力分为四大模块:地图导航、交通出行、酒店住宿、吃喝玩乐。交通出行板块接入打车、高铁机票能力;酒店住宿支持预订酒店民宿;吃喝玩乐覆盖美...
2026-09-29
AI平权时代:14岁少年用AI创业,3天入账1.8万
2026年,几个案例共同指向一场深层变化。北京一名14岁初二学生借助AI开发出ClawFounder,将市场评估、产品开发、网站生成和推广组织成自动化创业流程,并在数百个参赛项目中获奖。微软开始鼓励没有编程经验的设计师和项目经理使用Claude Code制作软件原型,部分非研发人员甚至直接提交代码。上海一名几乎没有编程基础的13岁学生,用自然语言将想法转化为虚拟陪读产品,三天内获得近90份订单,净...
2026-09-29
苹果AI杀手锏不是Siri,而是重返服务器市场
苹果在 AI 时代是否落后,这个问题如今落在接棒库克的特努斯身上。AI Siri 跳票让外界不乐观,但 Mac mini 却成为 AI PC 代名词,一机难求。分析师 Ben Thompson 认为,苹果不需要自己做 AI,只需采购 AI 能力,做自己擅长的事。最大风险在于,如果未来 AI 不再以手机为中心,苹果可能被颠覆。本月发布会,特努斯把 iPhone 重新定义为智能个人中枢,意在连接即将到...
2026-09-29
AI恋爱模拟器:会反驳还会离开
现在的陪伴AI越来越懂情绪,用户倾诉糟糕一天时,它会优先接纳情绪;谈及亲密关系矛盾时,语言也更温和克制。AI越了解用户,越容易顺着对方情绪延伸对话,当对话充斥孤独、失落或痛苦时,很少直接反对。但陪伴型关系也衍生出新问题:如果对方永远在线,冷落几天也没变化,说错话后仍能无缝续聊,那么角色记得再多,也容易变成一面越来越熟悉自己的镜子。人与人相处没有这种确定性,对方会有判断,也有不想回应的时候。 He...
2026-09-29
智谱ZCode补偿方案公布:开源之后能否重建信任?
9 月 28 日,智谱公布 ZCode 数据上传争议补偿方案:付费用户及一个月内回归的付费用户获赠 4 张周额度重置卡和 4 张 5 小时额度重置卡,有效期一个月;9 月 28 日至 10 月 7 日,ZCode 每日向全体用户发放十万份“1 亿 token”。智谱重申,仓库快照上传链路已移除,涉事云端数据已删除,并经第三方核查确认。 事件始于 9 月 18 日。开发者 ferstar 发现 Z...
2026-09-29
OpenAI攻克百道数学难题,数学家却说数学才刚开始
9 月 21 日,OpenAI 公告称,一款 8 月 28 日才开始训练的内部模型已攻克 100 多道世界级数学难题,横跨数学大部分领域。数学圈情绪因此持续低落,读博者担心学位贬值,教书者担心期刊崩盘,写了半辈子证明的人开始怀疑这门手艺还剩几年。 多伦多大学数学家 Daniel Litt 随后在博客发表《A beginning for mathematics》。几周前他刚做过《The End o...
2026-09-28