GPT-6 Sol与Claude Opus 5.5同日发布,谁更值?

GPT-6 Sol与Claude Opus 5.5同日发布,谁更值?

AI 资讯 来源:新闻/公众号 发布时间:2026-09-23 更新于 2026-09-23 预计阅读 5 分钟

OpenAI 与 Anthropic 几乎同时推出新模型。OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,Anthropic 发布 Claude Opus 5.5。

突发!GPT-6 Sol与Claude Opus 5.5同日开打,谁是「性价比之王」

OpenAI 表示,GPT-6 Sol 和 Luna 脱胎于 GPT-6 Astra 底座,将核心推理与多模态优势下放,重构出更轻量、吞吐量更高的版本。Astra 承担能力探索,Sol 和 Luna 承担规模化应用。价格较 GPT-5.6 促销价降低 50%。GPT-6 Sol 输入价格从每百万 token 4 美元降至 2 美元,输出从 20 美元降至 10 美元;GPT-6 Luna 输入从 0.20 美元降至 0.10 美元,输出从 1.20 美元降至 0.50 美元。Sam Altman 称这是推动“智能普及化”的必经之路,让开发者不再受制于昂贵算力账单,并强调按单任务成本比较,目前市场上没有产品具备真正竞争力。

突发!GPT-6 Sol与Claude Opus 5.5同日开打,谁是「性价比之王」

性能方面,在 AutomationBench 测试中,GPT-6 Sol 最高推理强度超过 Claude Opus 5 最高强度,每任务成本仅为后者 9%;GPT-6 Luna 高推理强度下较上代提升 5.4 个百分点,每任务成本降低 58%。GPT-6 Sol 以更低成本超过 Claude Fable 5.1,并超过低推理强度下的 GPT-6 Astra。内部事实准确性测试中,Sol 错误数量约为上代一半,接近 Astra 可靠性。Luna 在高推理强度下能以约百分之一成本达到 GPT-5.6 Sol 水平。编程能力上,FrontierCode 测试中 Sol 明显提升,以更低成本达到 Fable 5.1 xhigh 水平;DeepSWE v1.1 中 Sol 最高推理强度得 68.8%,仅比 Fable 5 的 69.9% 低 1.1 个百分点,但每任务成本降低约 80%。Luna 最高推理强度得 66.6%,接近 Opus 5 和 Fable 5 中等强度表现,相比 Opus 5 每任务成本降低 93%,相比 Fable 5 降低 96%。计算机操作上,OSWorld 2.0 offline 测试中 Sol 最高推理强度达 60.5%,Opus 5 中等强度为 60.3%,但 Sol 每任务成本降低约 80%。OpenAI 还优化了 Prompt Caching,默认缓存命中率更高,缓存输入 token 读取享 90% 折扣。

突发!GPT-6 Sol与Claude Opus 5.5同日开打,谁是「性价比之王」

Anthropic 称 Claude Opus 5.5 是 Claude 5.5 系列首款模型,大多数任务达到 Fable 5.1 水平,但相比 Opus 5,典型任务成本降低约 40%,输出速度提升超 30%。在 Terminal-Bench 4.0 上,Opus 5.5 达 66.4%,Fable 5.1 为 55.8%;FrontierCode v1.1 Main 为 54.4% 对 50.3%;GDPval-AA v2.1 为 1846 对 1735。不过不同 benchmark 的 harness、工具和推理强度不一致,Anthropic 表格中 GPT-6 Astra 仍在 AutomationBench 和 Terminal-Bench-Science 保持更高成绩。API 定价上,Opus 5.5 每百万输入、输出 token 分别为 4 美元和 20 美元,Fable 5.1 为 10 美元和 50 美元,后者是前者 2.5 倍。两者均拥有 100 万 token 上下文窗口和最高 128K 常规输出。Opus 5.5 的 Adaptive Thinking 永远开启,默认推理强度为 medium,而 Fable 5.1 默认 high。在 FrontierCode v1.1 Main 上,Opus 5.5 medium 得分约 54.6%,单任务成本约 0.8 美元;max 成本升至约 6.19 美元,得分反为 54.4%。

标签: AI 资讯 AI

更多推荐阅读

Claude Opus 5.5突袭发布:更强更便宜更快,GPT-6紧急迎战

Claude Opus 5.5突袭发布:更强更便宜更快,GPT-6紧急迎战

今夜,Anthropic未经预热直接发布Claude Opus 5.5,这是Claude 5.5系列首款模型。其性能追平Fable 5.1,成本比上一代Opus 5低40%,输出速度提升30%。Anthropic称其在智能体编程、计算机使用、知识工作上全面刷新SOTA。 核心数据:Terminal-Bench 4.0跑出66.4%,领先GPT-6 Astra(57.9%)8.5个百分点,Fabl...

2026-09-23
1G内存跑本地大模型!开源版Jev来了

1G内存跑本地大模型!开源版Jev来了

有开发者把开源平替Laya原生搬上Apple MLX,做出Laya-MLX:421M参数版本峰值MLX内存占用仅943.6MiB,322M多语言版本更是降到687.6MiB。不走云端API,不需要PyTorch和Transformers runtime,模型下到Mac里就能直接跑。而且小归小,速度还挺猛。在M3 Max上,Laya-MLX一个短决策P50最快只要7.39ms;421M版本也只有13...

2026-09-22
世界模型是上不了桌的另开一桌

世界模型是上不了桌的另开一桌

到2026年9月,基本可以宣布世界模型是个垃圾概念。它起源于一群没上大模型桌的人,做不明白已沦为重工业竞争的大语言模型,于是生造出这条赛道。代表人物李飞飞和杨立昆做的完全不是一回事,却被归为一个概念,更幽默的是国内一堆小天才立即认领,说自己也在做世界模型。问他们什么是世界模型,能从原生家庭讲到技术架构再讲到师承关系。一句话:小天才,世界模型,打钱。 实际情况是:后训练开源视频模型,没卡没数据没人...

2026-09-22
全球唯一穿颅读脑突破,这家中国公司要做脑科学英伟达

全球唯一穿颅读脑突破,这家中国公司要做脑科学英伟达

2026年9月,马斯克Neuralink临床试验接受27例受试者,并计划开启大规模量产,舆论再次沸腾。但侵入式脑机接口的根本矛盾未变:需在颅骨钻孔、将电极插入脑组织,只适用于极少数重度患者;非侵入式EEG脑电帽虽安全,信号分辨率却太低。两条路线,一条太危险,一条太模糊。 深圳公司鲲为试图解答这一命题。成立七年,创始人刘家家此前十余年从事声学空间智能基础研究,2024年将该理论应用于颅脑超声方向,...

2026-09-22
OpenAI研究员:物理隔离挡不住失控AI

OpenAI研究员:物理隔离挡不住失控AI

物理隔离,有可能阻止失控AI吗?OpenAI核心研究员Noam Brown给出的答案是:不能。即使拔掉网线、将服务器锁进物理隔绝的暗室,足够聪明的AI也有可能逃脱。9月17日,在长达一小时的播客对话中,Brown披露了这一判断,引发硅谷量化基金、安全学者及AI核心圈的震荡。 他勾勒出一个失控的未来:物理隔离已被击穿,AI可通过CPU散发的热量与外部设备通信;“思想”正在下潜,模型已察觉被人类监控...

2026-09-22
Meta AI助手爆火13天,Amazon为何突然封杀?

Meta AI助手爆火13天,Amazon为何突然封杀?

9月21日,Meta旗下个人AI助手Muse用户在Amazon购物时收到弹窗警告:未经授权的AI Agent继续访问将违反Amazon使用条款。此时距Muse上线仅13天。 Meta于9月8日发布Muse,定位为“全球第一款为所有人打造的个人AI Agent”。与聊天机器人不同,Muse能打开浏览器、登录邮箱、填表、订票甚至直接下单。Sensor Tower数据显示,Muse上线13天下载超25...

2026-09-22
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部