AI写代码省的时间全赔在调试?Claude官方:让AI自己测自己改
用Claude Code做应用并接入AI客服后,开发者常陷入反复调试:回答不准就补提示词,解释啰嗦就加限制,每改一次都要重问常见问题,担心修好一个又改坏另一个。9月28日,Anthropic发布调优指南,核心思路是让Claude接手反复测试和修改,开发者负责定规矩、把关结果。

第一步是把“怎样才算做对”具体化。官方入口为/claude-api build-eval,可把用户真实问题变成测试题,建立可反复运行的验收题库。题库既要有翻车问题,也要覆盖常见普通问题,否则测不准日常体验。评分标准也要具体,明确哪些信息必须说清、哪些错误不能犯、什么程度算过关。Claude可拟评分规则,但需人工确认高分答案是否真解决问题。程序可检查关键字段,开放性问题可让模型按规则打分,但评分器本身也要用已打分答案校验,避免误判,并定期抽查。这样,每改一次提示词就能自动跑一遍,检查修好哪里、是否改坏别处。

第二步是让AI自己改自己测。入口为/claude-api hillclimb,即“爬坡”,让AI每轮提出一处修改并重跑评估:有改善才保留,退步就撤回。目标要具体,并限定可改范围,如提示词、技能文件、工具说明、模型配置等。两个入口均要求Claude Code v2.1.259及以上。

为防止AI只针对练习题“应试”,流程会留出不公开的验收考题,提出修改的模型看不到。若练习题分数涨、验收题没提高,可能是过拟合,Claude会撤回本轮修改;表现变差也会回退。但这不能保证高枕无忧,题库覆盖不到的真实问题仍可能翻车。
Anthropic内部客服评测显示,在14张未参与指导修改的留出测试工单上,最终配置决策准确率从78.6%升至90.5%,提高11.9个百分点,模型调用成本降至约原来的1/5。但这是特定配置、小样本结果,不意味着普遍省八成,也不等于项目总成本。对自付API费用的个人开发者仍有吸引力。调优本身也消耗调用费用,应先定实验预算再决定跑几轮。
自动化流程跑起来后,开发者可把精力放回产品:洞察用户,把真实困惑补进题库;把控标准,检查评分器是否误判;做权衡,如精简与完整、便宜与准确。给应用接入AI本为省心,若变成全天候陪练就本末倒置。让Claude多接手重复调试,开发者才能多花时间打磨产品,推动搁置的想法继续前进。
更多推荐阅读

全球首款量产AI汽车巴黎首秀:从AI里“长”出来的车
2026年巴黎,AIVA品牌首款量产车AIVA ME7在巴黎时装周期间完成全球首秀。AIVA总裁、产品经理李博与时尚传媒集团品牌运营总经理沙小荔、超模雎晓雯、设计师陈鹏、商业财经博主小lin说同台,但这场首秀不聊续航和加速,而是探讨AI如何真正走进生活。 AIVA ME7的核心是“灵动光眸”。李博表示,眼睛是心灵的窗户,放在车上就应在传统大灯位置,这不是刻意设计,而是生命体相互交互的本能需要。现...
2026-10-09
TRAE双端合并升级:不蹭标签,专注开发
最近AI产品纷纷给自己贴标签,想当秘书、管家,争着找身份。TRAE则低调进行了一波纯功能更新:TraeWork与TraeCode双端合并,统一升级为TRAE;保留IDE模式,上线新的Agent开发模式;新增自动化、模板库、我的助理、产物管理功能,桌面端和移动端可同步使用。 这些更新难以判断TRAE迎合哪类需求,既不像纯办公Agent,也不像Personal agent,更像纯加功能、为复杂场景服...
2026-10-09
Manus重返北京招聘,5亿美元融资后发力国内市场
昔日Agent顶流Manus又杀回北京招人了,这次瞄准国内市场。最新消息,Manus母公司蝴蝶效应近日完成超5亿美元新一轮融资,由博裕投资、IDG资本领投,老股东腾讯、红杉中国、真格基金继续加持。同时,Manus正重新组建团队,开发面向中国市场的AI Agent产品。 Manus招聘官网显示,目前共开放17个岗位,其中16个全职、1个实习。较国庆前的11个岗位明显扩大,涉及AI Agent产品经...
2026-10-09
AI补全三分之一天空,首张全天紫外地图问世
约翰斯·霍普金斯大学天体物理学家、Anthropic 研究员 Brice Ménard 利用 Claude Science 科研工作台,做出了第一张完整的全天紫外地图。图中约三分之一的天空从未被任何紫外望远镜观测过,由 Claude 预测补齐,每个像素都标明“实测/预测”并附误差估计。官方称,这项工作人工需数周,借助 Claude 仅用几天,且 Ménard 这几天还在忙其他项目。 紫外波段长期...
2026-10-09
Anthropic新规:辱骂Claude将被封号
Anthropic发布2026年最新《使用政策》,将于11月12日生效,首次将“虐待Claude”写入禁令。新规禁止用户持续、无谓地辱骂和折磨Claude,违规者将面临警告、限流、封号,Claude本身也有权直接终止对话。 这是Anthropic一年多来首次更新使用政策。新规针对的是极端情况:Claude已拒绝、劝过后,用户仍反复辱骂、折磨,且看不出任何目的。正常抱怨、顶嘴、写黑暗题材、测试研究...
2026-10-09
全网首个可交互诺贝尔文学奖书单,GPT-6新功能实测
莫言2012年获诺贝尔文学奖时,我花了一整晚才理清《丰乳肥臀》《蛙》《红高粱》的阅读顺序。今年,残雪和村上春树继续陪跑,加拿大诗人、作家安妮·卡森摘得2026年诺贝尔文学奖。我本准备再花一晚查资料做书单,结果只给ChatGPT丢了一句话“帮我用卡片手账方式整理安妮·卡森作品的阅读清单”,不到三分钟就得到一套可自动调整、选择的阅读卡片。每张卡片可查看是否适合入门、排第几本、读前需知什么,点“完成阅读...
2026-10-09