Claude新模型跑分翻倍,科研与安全场景表现惊艳

Claude新模型跑分翻倍,科研与安全场景表现惊艳

AI 资讯 来源:新闻/公众号 发布时间:2026-09-02 更新于 2026-09-02 预计阅读 4 分钟

Anthropic近日发布两款新模型:Claude Fable 5.1与Mythos 5.1。其中,Fable 5.1已全平台上线,而Mythos 5.1仅向受审核的网络安全与生命科学团队开放。跑分数据显示,Fable 5.1在科研基准Terminal-Bench-Science 0.1上得分52.6%,远超上代Fable 5的24.7%和GPT-5.6 Sol的22.4%,实现断层式领先。

在代码基准Terminal-Bench 4.0上,Fable 5.1得分55.8%,Mythos 5.1则达到60.9%。知识工作基准GDPval-AA中,Fable 5.1获得1853分,在高难基准带工具实测中得分超过65.0%。这些数字意味着新模型在复杂任务处理能力上有了质的飞跃。

定价方面,Fable 5.1输入每百万Token 10美元、输出50美元,与上代持平,但缓存读取价格从1美元降至0.25美元,降幅达75%。普通场景总成本降低25%,长战线Agent任务最高可节省45%。相比之下,GPT-5.6 Sol短上下文促销价为输入2美元、输出10美元、缓存0.2美元。

Anthropic还公布了三个前沿应用案例。Fable 5.1利用NASA麦哲伦号30多年前的雷达数据,训练神经网络生成覆盖金星约三分之一面积的高分辨率地形图,将细节从10-20公里推进至2-3公里,高度估计准确性最高提升25%。Mythos 5.1设计的蛋白质在EGFR、Nipah G等三个靶点上亲和力达到Adaptyv Bio竞赛最佳方案的10倍,12个靶点总体命中率近50%,而领域常态命中率仅为10%-15%。此外,Mythos 5.1还为7个开源生物模型手写GPU Kernel,速度最高提升2.5倍,输出与原版完全一致。一项扫描三百万变异的分析成本从1.8万美元降至8千美元。

在实际应用中,Fable 5.1在CursorBench 3.2上得分73.4%,在AutomationBench中成绩31.4%,几近翻倍。它曾帮助对冲基金Millennium解决一个潜伏四五年的Bug,通过反汇编第三方库定位病根。实测显示,Fable 5.1生成图像更写实,但花费5.69美元,GPT-5.6 Sol仅0.88美元且风格稳定。Fable 5.1还能自主完成房屋设计、生成电影级漫游导览,手搓交互式人脑模型,并一次生成ARC生存游戏。

安全策略上,Fable 5.1放开了代码漏洞识别权限,网络安全误报率降低六成,但禁止编写攻击代码。同时,API底层新增反蒸馏机制,严查上下文一致性,提示词与生成思维块不符时直接报错或移除思维块。该机制先对8月31日后注册的API新账号生效,未来将强制覆盖所有新模型。

从跑分到实际应用,Claude新模型展现出强大的能力提升,尤其在科研与安全领域。随着反蒸馏机制的逐步推广,Anthropic在模型安全与性能平衡上的探索,或将为行业树立新标杆。

标签: AI 资讯 AI

更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速

世界模型专家刘宇加盟理想,机器人基座模型研发提速

理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。

2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启

AI办公赛道巨头混战,Agent创业窗口反而开启

2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。

2026-09-05
AI报告读着累?新指标用隐喻率量化可读性

AI报告读着累?新指标用隐喻率量化可读性

Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。

2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%

AI科学家K Pro上岗,全球最大药企研发提速70%

Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。

2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿

估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿

Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。

2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明

AI攻克费马大定理:Claude 11天写出1300万行证明

Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。

2026-09-05
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部