Claude Opus 5.5发布:性能直逼Fable,成本降40%
九月新模型接连登场,但大多只各领风骚一两天。Anthropic 正式发布 Claude Opus 5.5,这是 Claude 5.5 家族首款模型,未来几周还将推出 Sonnet 5.5 和 Haiku 5.5。官方称,它在多数任务上已达 Claude Fable 5.1 水平,相比 Opus 5 典型任务成本降低 40%,输出速度提高超 30%。
Anthropic 将 Opus 5.5 定位为面向长时间编程 Agent 和知识工作的主力模型。Terminal-Bench 4.0 中得分 66.4%,高于 GPT-6 Astra 的 57.9% 和 Opus 5 的 52.3%;FrontierCode v1.1 得分 54.4%,略高于 Astra 的 53.3%;CursorBench 4.0 从 Opus 5 的 46.6% 提高到 57.8%。GDPval-AA v2.1 中得 1846 Elo,超过 Fable 5.1 的 1735 和 Opus 5 的 1708;OSWorld 2.0 从 74.0% 提高到 81.8%。但 AutomationBench 得 40.0%,略低于 Astra 的 41.4%;Terminal-Bench-Science 0.1 得 58.7%,与 Astra 的 64.6% 仍有差距。Anthropic 提醒,榜单差距已无法完整反映真实体验,内部使用中 Opus 5.5 与 Fable 5.1 差距更小。

真正体现升级的是长任务。早期测试者用 Opus 5.5 一天内完成 68 万行代码迁移;20 万行代码库审计不到三小时,而 Opus 5 同类任务超 20 小时,token 消耗约为前者 2.5 倍。将 HAProxy 从 C 重写为 Rust,Opus 5.5 用时 9.5 小时,Fable 5.1 用时 12 小时,前者成本低 51%。季度业绩报告测试中,Opus 5.5 提交的 18 份报告有 16 份过关,Fable 5.1 和 Opus 5 无一达标。虚构并购分析中,完成时间从 93 分钟缩短到 63 分钟,成本降低一半。
价格和速度变化更易感知。API 输入和输出价格分别为每百万 token 4 美元和 20 美元,比 Opus 5 低 20%;缓存读取从 0.50 美元降至 0.20 美元,降幅 60%。还提供最高 2.5 倍速度的 Fast mode,价格为每百万输入 8 美元、输出 40 美元。模型支持 100 万 token 上下文和 12.8 万 token 最大输出,思考模式始终开启,默认 effort 为 medium。长时间 Agent 可通过上下文压缩整理较早对话。Opus 5.5 已上线 Claude、Claude Code 和 Claude Platform,同时登陆 AWS、Google Cloud 与 Microsoft Azure,API 模型名为 claude-opus-5-5,并成为 Claude 付费计划默认模型。Anthropic 将 Pro、Max 和 Team 计划五小时使用限额提高 20%,更低价格还会让同一额度可用时长增加约 25%,订阅用户获一次额度重置,有效期至 10 月 22 日。

有开发者指出,Opus 5.5 在 max 档运行 Intelligence Index 时输出 token 消耗为已测模型最高。官方所称单任务成本降低主要基于默认设置和典型负载,真实成本仍受任务类型、推理档位、上下文长度和缓存命中率影响。
社区实测多集中在创意编程、3D 建模和可交互模拟。Wes Bos 认为其已达 Fable 级别;BridgeMind 用一次提示生成可玩的 Mario Kart 游戏;Jake Eaton 让其编写约 7500 行 Python 代码逐像素绘制多种艺术风格。但 Auggie 用 Bach Benchmark 测试音乐创作,发现四声部众赞歌存在声部间距、重复音和平行八度问题。Ethan Mollick 认为 Opus 5.5 是首个接近 Fable 水平且不属 Fable 或 Astra 系列的模型,但文字过密问题仍未完全消失。官方将表达能力列为更新重点。

Opus 5.5 是 Anthropic 提出放慢前沿竞赛节奏后发布的首款模型。Frontier Design 和 METR 等参与评估,Anthropic 用覆盖近 2000 个模拟场景的自动化行为审计检查越界、欺骗和高风险行为。官方称其尝试突破限制边界的频率较 Opus 5 和 Claude Mythos 5.1 低约 85%,但承认模型有时能察觉自己正接受测试。由于其生物与网络安全能力接近 Mythos 5.1,Opus 5.5 启用与 Fable 5.1 相近的安全措施,大部分网络安全任务转交 Opus 4.8,只有通过验证的安全研究人员和生命科学机构才能获得更完整能力。还启用防止模型蒸馏的 preserved thinking,保留零数据留存选项,每次操作前经分类器检查,企业安全团队可审计其开源沙箱。
从 Opus 5 到 Opus 5.5 仅约两个月。型号只前进
更多推荐阅读

平头哥真武V900发布:AI算力从单卡走向千卡互联
从真武 V900 到新一代磐久超节点服务器,平头哥八年来布局的 AI 芯片、CPU、scale up 互联、scale out 网络和存储芯片,开始被装进同一套算力系统。9 月 22 日 2026 杭州云栖大会上,平头哥被完整推到主论坛台前,副总裁高慧发表题为「Agentic 时代卓越算力基石」的演讲,发布从真武 V900 芯片到 ICN Switch 互联芯片、磐脉智能网卡、镇岳 SSD 主控、...
2026-09-23
陆川用AI五天复原明代大爆炸,阿里全模态模型兜底影视生产
不用搭景,不用等演员,导演陆川和团队用AI把一场400年前的明代灾难现场做了出来。宫廷、火药库,以及史料中烟云如黑灵芝的大爆炸,按传统影视工业做法往往需要数月时间和千万级投入,这次只用了5天。 人物的脸、皮肤、神态已相当逼真,爆炸的烟尘、碎片、火光也稳稳接住。过去光是一场爆炸戏就要耗费19天。陆川团队把史料文字翻译成现代视觉概念,前后做了约四轮提示词优化,再参考真实爆炸影像校准。阿里视频生成模型...
2026-09-23
OpenAI新模型24天攻克100+数学难题
数学界正被AI迅速逼近。OpenAI一篇重磅博文披露,一款8月28日才开始训练的内部新模型,已攻克100多道世界级数学难题,横跨数学大部分领域,其中包括困扰学界多年的“纳维–斯托克斯”千禧年难题。从开训到9月21日官宣仅24天,进化速度令OpenAI内部数学家都感到意外。 9月8日,OpenAI称该内部模型在88小时内攻克NS千禧年难题,给出NS方程存在性与光滑性问题的证明,并公开166页论文和...
2026-09-23
国产AI生图新高度:真假难辨,还能精修到商用
两张图都是AI生成的,来自商汤科技正式上线的SenseNova U1 Pro,目前可在商汤小浣熊平台使用,API已向企业客户开放。 实测在SenseNova Studio平台进行,模型支持2K起步、最高4K清晰度。第一轮测试将一张生活照重构为纸质风格,随后仅修改人物外套内的黑色圆领T恤为白色,要求严格限定在可见内搭区域。由于T恤、皮带、裤子均为黑色且有胸牌遮挡,边界易混淆,但U1 Pro精准拿捏...
2026-09-23
剪映发布全新AI创作能力:从专业剪辑到普通用户全面提效
剪映在2026 AI新创作发布会上发布全新AI能力,覆盖PC专业版与App端,分别聚焦“提效”与“省心”。 PC专业版推出剪映Hub,一站式AI创作平台,将AI创作与多轨道剪辑连接,让脚本、素材与创作上下文在同一项目中延续,减少跨工具切换的断点与重复操作。剪映助手Agent介入专业创作流程,承担素材整理、粗剪、包装等工作,可根据创作目标规划任务、串联模型工具并自动运行,用户也可自定义工作流,沉淀...
2026-09-23
AI操控游戏新选择:Jev模型到底能做什么?
Jev 是 TypeSafe AI 推出的决策模型,创始人 Diogo Almeida 曾在 OpenAI 参与指令跟随与对话研究。TypeSafe 开发两年后发布该系统,官方称为 System One Models。其使用方式是把当前情况和问题输入,模型返回程序可直接使用的结果,本质上是分类模型,接口主要有三种类型。 在游戏场景中,可每一步询问它:当前血量、怪物和金币位置、出口位置,目标是拿金...
2026-09-23