Sonnet 5.5发布:速度提升30%,成本暴降,性能反超Opus
就在OpenAI年度开发者大会开幕前一天,Anthropic发布Claude Sonnet 5.5。作为Opus 5.5的搭档,它定位为最快、最省钱、最懂日常工作的全能助手。相比Sonnet 5,运行速度快30%,完成相同任务成本最高降低30%,标价仅为Opus 5.5的一半,性能却几乎追平。
在智能体编程测试Terminal-Bench 4.0中,Sonnet 5.5得分70.6%,约为原来的7倍,超过Opus 5.5的66.4%,从垫底跃居自家第一。第三方评测机构Artificial Analysis智能指数榜前三名全被Claude包揽,Sonnet 5.5排第二,第三名是四周前发布的Fable 5.1,标价为Sonnet 5.5的5倍。

用户可调节Effort Level:低/中等档回答快、耗Token少,适合日常任务;高/最大档进入思考模式,反复检查,用于复杂难题。
Sonnet 5.5打破了速度快、成本低、质量高的不可能三角。输出速度比前代提升超30%,定价与Sonnet 5相同:每百万输入Token 2美元,输出10美元,缓存读取0.20美元。但因模型更聪明,所需Token大幅减少,每任务实际成本最多降低30%。

Artificial Analysis榜单上,Sonnet 5.5得64%,高于Opus 5.5和GPT-6 Astra的60%。Terminal-Bench-Science得53%,排第三。FrontierCode最高52.1%,超过GPT-6 Sol的49.3%。CursorBench得55.5%,仅比大杯低2个多点,上一代仅34.1%。开发者称其理解庞大代码库速度极快,工具调用可批量打包,步骤更少、报错更少、花钱更少。
办公能力也追平Opus 5.5:GDPval-AA得1844分,Opus 5.5为1846分;AA-Briefcase得1811分,Opus 5.5为1822分,比GPT-6 Sol高300多分。它还展现出设计天赋,能主动美化UI、遵循幻灯片模板生成几乎无需修改的PPT。内部测试中,它根据财报资料、电话会议记录和模板生成的10页运营审查幻灯片,被两位人类专家鉴定为完美、可直接发送。带工具的人类最后考试得64.5%,比上一代高近10个点。Vals Index首次上榜排第二,仅比Opus 5.5低0.47分。

四周前Fable 5.1还是全球最强编程和知识工作模型,如今Sonnet 5.5在Terminal-Bench 4.0上高出近15个点,GDPval-AA高109分,智能指数高3分。复杂办公测试Box中,整体准确率65%,Sonnet 5为61%,交付速度快约2.4倍,总Token消耗降低12%。
实测显示,AI博主Matthew Berman用Sonnet 5.5在虚幻引擎中搭建旧金山,输入泛美金字塔起火后,系统自主派出5辆消防车和3辆警车。它还生成3D大海、糖豆人式闯关游戏、星舰V3交互爆炸图、在线乐高游戏等。Matthew Berman感慨3D模拟已被Claude攻克。但也有人持不同意见:Robbert van Empel的LEGO积木星球挑战中,Sonnet 5.5未能一次性构建整个世界,GPT Luna成功做到。
速度方面,同一题目下,Sonnet 5.5写完鸟群模拟代码、鸟群已飞9秒,上一代还在逐行输出。
Sonnet 5.5成为首个仅看游戏截图就通关《宝可梦 红》的中杯模型。此前Claude与宝可梦死磕一年多:Opus 4.5困在楼里数周不捡钥匙卡;Opus 4.6接近冠军却被机关卡数月;今年5月Opus 4.7才通关,靠放大截图和截图存记忆两个外挂。四个月后,Sonnet 5.5仅靠看截图一次性通关。关键原因是长出眼睛:Chartography测试从15.6%暴涨到61.6%,OSWorld 2.1达80.1%,与Opus 5.5的81.8%仅差1.7个点。网友Goody让Sonnet 5.5开发墨西哥怪物风格Game Boy游戏《Nahual》,单文件2342行代码,连音乐都有。
不过,Sonnet 5.5标价便宜,最终能否省钱取决于Effort档位。努力档从Low到Max共五档。
更多推荐阅读

GPT-6一张图纸造出3295个零件
GPT-6 Astra发布后,OpenAI改变了以往靠跑分榜单展示能力的方式,转而让开发者直接“交作业”。开发者Tom Krcha将一张旧蒸汽机车图纸交给Astra,让它在Blender中重建。几分钟后,Blender里出现3295个可编辑独立对象,包括锅炉、连杆、车轮、铆钉,每个都能单独选中和修改。Krcha强调,Astra并非在Blender里点鼠标操作,而是全靠写Python脚本把零件逐个“...
2026-09-29
高通CEO安蒙谈智能体时代与中国速度
美国当地时间9月22日-24日,高通技术公司举办的2026骁龙峰会在夏威夷举行,首次同时发布第六代骁龙8超级至尊版与第六代骁龙8至尊版两款旗舰移动平台。“智能体AI”贯穿三天峰会,高通总裁兼CEO安蒙强调:“我们正从‘APP驱动’迈向意图驱动的‘智能体’时代。” 大会另一重要信号是端侧智能体落地:高通联合阶跃星辰、无量火、江波龙,将300亿参数的MoE大模型完整部署进手机端侧,让智能体以如此大的...
2026-09-29
88%企业用AI,仅6%真赚钱,阿里瓴羊推AI员工扛KPI
2025年,全球88%的受访企业已在至少一个业务职能中常态化使用AI,但能从中获得显著价值、贡献至少5%息税前利润的“AI高绩效企业”仅占6%。大量AI进入公司,真正帮企业赚钱的却不多。员工用AI把200字总结扩成几十页PPT,老板又用AI压回200字,Token消耗不少,工时省了一些,但企业收入、转化和留存没有改变。 2026云栖大会上,阿里云智能集团瓴羊CEO朋新宇指出,AI可以从效率革命起...
2026-09-29
Sharpa发布首款人形机器人D01,三款新品打通具身智能操作闭环
一双会盘核桃、能做冰淇淋的灵巧手,让Sharpa为人熟知。这家禾赛科技创始团队再出发的具身智能公司,最鲜明的标签是高自由度触觉灵巧手。在正在进行的IROS上,Sharpa推出首款全自研通用人形机器人D01、新一代灵巧手W02及外骨骼数据手套AE01,一次性覆盖手、身体和数据入口。 D01定位一体式触觉感知灵巧操作机器人,手臂载荷自重比接近1:1,最大末端执行器速度超10.5m/s,通信频率100...
2026-09-29
华为联合团队夺SAT 2026大赛AI赛道冠军
近期,约束求解与形式化领域国际顶级赛事 SAT Competition 2026 落幕。由华为诺亚方舟实验室、华为云天筹 AI 求解器团队和华中科技大学 John Hopcroft 计算中心组成的联合团队,获得并行 AI 赛道 SAT 组冠军。 SAT 问题被誉为计算复杂性理论中的“珠穆朗玛峰”,从硬件验证、软件测试到密码学分析与 AI 规划,SAT 求解器已成为自动驾驶、EDA 芯片设计等产业...
2026-09-29
西门子Xcelerator如何让工业创新从单打独斗变组团作战
一家技术公司想把工业创新方案卖进工厂,要过多少关?技术先做出来,再找场景验证,然后找客户、做适配、打通系统、完成交付。想复制到十家、一百家工厂,渠道、行业Know-how、本地服务甚至海外资源都得补齐。很多技术型公司难啃的部分,往往从产品做出来之后才开始。 工业客户也有烦恼:市面上的AI、机器人、工业软件越来越多,但谁真正懂现场、谁经过验证、不同公司能力能否拼成完整方案,仍需大量时间筛选。供需两...
2026-09-29