Sonnet 5.5六天反超Opus,中杯追平旗舰
说好的未来几周,Anthropic只等了6天。上周Opus 5.5发布时官方剧透Sonnet 5.5和Haiku 5.5都在后面,如今Sonnet 5.5先到了,Claude家的“中杯”已经撵着刚发布的旗舰追了。

上周Opus 5.5发布时,Terminal-Bench 4.0的66.4%还是挺能打的成绩。Sonnet 5.5一来直接干到70.6%,上一代Sonnet 5只有10.3%。在覆盖44种职业真实任务的GDPval-AA里,Opus 5.5拿到1846 Elo,Sonnet 5.5已追到1844;OSWorld 2.1测试计算机操作,两者分别拿到81.8%和80.1%。当然,碰上复杂、开放式、需要长时间判断的任务,Opus 5.5依然明显更强。Sonnet 5.5更适合日常Coding、修Bug、做文档、PPT、表格这些边界比较明确的活。价格继续保持Sonnet档:输入2美元/百万Token,输出10美元/百万Token,正好只有Opus 5.5的一半。

Sonnet这次不只是更会写代码,干活方式也更利索。早期测试发现,新Sonnet不太爱一个工具一个工具往下磨,能并行处理的调用会更积极地放到一起。完成同样一项Coding任务,工具调用少了约三分之一,Shell运行次数差不多砍半。Base44拿118个真实App构建任务来测,Sonnet 5.5平均跑3.6轮就能做到和Opus 5相当的结果,后者平均需要7.7轮;同时新Sonnet还是这组测试里工具调用失败最少的模型。Epic Games让Sonnet 5.5去啃数万行游戏系统代码,检查系统架构和数据流;Unity的验收方式是模型改完代码后把项目重新打开,真正跑起来才算完成,最后Sonnet 5.5做完了他们多步骤Unity Editor和Coding测试中90%的任务。Anthropic祖传的宝可梦也没落下,Sonnet 5.5成了Claude家第一款只看游戏截图就成功通关《宝可梦:红》的Sonnet。这一代Sonnet还多了点设计感,给定幻灯片模版就能照着原来的版式和视觉规范往下做,生成的PPT只需少量人工调整。

Sonnet 5.5这次API单价没动,每百万输入Token还是2美元,输出还是10美元,缓存读取维持0.2美元,和Sonnet 5完全一样。但Anthropic测下来,完成大多数任务的实际成本最高能再降30%,速度提升30%以上。Anthropic还专门算起另一笔账:同样的钱,模型到底能干多少活。Terminal-Bench 4.0上,Sonnet 5.5只开到Medium effort,已超过Sonnet 5能做到的最好成绩,单任务成本却不到后者的十分之一。CursorBench更省,Sonnet 5.5甚至只开Low effort就能超过Sonnet 5的最高成绩,同样只花不到十分之一的钱。到了FrontierCode,比较对象直接换成GPT-6 Sol。在Claude Platform默认的High effort下,Sonnet 5.5能做到和GPT-6 Sol最佳成绩相当,而Anthropic给出的单任务成本大约只有后者的五分之一。
这两周Claude连续更新,Anthropic已经越来越喜欢把一个数字放在Benchmark旁边:完成一项任务,到底花多少钱。而Anthropic接下来还有一款模型,更是来卷这笔账的——Haiku 5.5。Anthropic给它的定位很明确,高吞吐量、成本敏感型。
更多推荐阅读

AI员工接管企业SaaS,Ema融资7700万估值翻4倍
AI 初创公司 Ema 正试图让 AI 智能体团队接管企业内部的人力资源、IT 和财务等业务流程。随着 AI 开始承担过去由企业软件和 IT 服务完成的工作,Ema 宣布完成新一轮 7700 万美元融资。本轮 B 轮融资由印度班加罗尔风投机构 Creaegis 领投,现有投资者 Accel、Section 32 和 Prosus 继续加码。融资完成后,Ema 累计融资额达 1.4 亿美元,估值较 ...
2026-09-29
可灵4.0内测:30秒一镜到底,支持10关键帧与HDR
可灵AI宣布最新旗舰视频生成模型Kling 4.0开启内测,将于10月正式上线,同时推出生成速度更快、性价比更高的Kling 4.0 Flash。两款模型API价格暂未公布,Flash已于昨日面向可灵最高档会员(每月916元起)开放体验。 这是Kling系列时隔8个月的大版本更新,上次为今年1月31日的Kling 3.0。Kling 4.0升级集中在视听质感、创意控制和叙事能力三方面。 Kli...
2026-09-29
1小时微调专属Jev模型,单卡实测准确率78%
开源版 Jev 教程发布后,不少读者反馈模型在演示用例上表现顺畅,但接入实际业务时意图判不准、分类标签对不上。原因在于开源复刻版本提供的是在公开通用数据上训练的权重,学习到的是特定业务场景与候选描述,而不同团队的 Agent 处理状态、路由类别和判断口径各不相同,直接套用通用权重准确率必然下降。 根本解决办法是基于自己的数据训练。本篇教程带大家在本地从零走通完整训练流水线,涵盖下载底座与数据、预...
2026-09-29
百万月活AI热点网站AIHOT正式开源
今天,我决定将月活百万的AI热点资讯网站AIHOT正式开源,网址为https://aihot.news/。它最初只是公司内部用于监控热点、寻找选题的飞书机器人,后来发展为拥有百万月活、近10万Skill用户,以及众多基于其API二次开发的项目。从年前借助AI开发第一版至今,已过去七八个月。很多人问我为何不商业化、一直免费,其实我只是单纯喜欢做产品,大家的鼓励和正反馈是我深夜坚持的最大动力。 开源...
2026-09-29
AI造AI时代来了?代季峰团队开源新模型
Naive AI 正在探索让当前 AI 模型承担下一代模型研发的路径,使每一代模型都能比上一代承担更多研发工作。 10 天前,Anthropic 公布内部数据:AI 研发工作中已有 26% 由 Claude「主导」完成,研究员只需给出高层指令,Claude 即可端到端完成大部分任务,人类负责监督;今年 2 月这一比例还不到 1%。更早几天,OpenAI 宣布去年定下的「自动化研究实习生」目标已达...
2026-09-29
腾讯秘密内测AI游戏搭子“鹅次元”
腾讯正在秘密内测AI游戏陪伴产品“鹅次元”,主打数字人AI搭子,提供语音对话、画面实时识别、游戏陪伴等能力。产品内置多位人设各异的男女虚拟角色,玩家选定后可闲聊互动或激活游戏陪伴模式,适配多款主流网游。全部功能限时免费,界面已露出星币兑换能量的付费框架。 实测中,进入产品后首先看到AI角色选择界面,可切换男女分类,女性角色有谷雨、沈露白、夏夏三位可选。选定“夏夏”后进入主交互界面,中间是数字人形...
2026-09-29