Claude四周重写30个生物模型,AI加速科学代码
Anthropic 发布研究称,Claude 在不到四周内优化了 30 多个开源生物分子模型,包括 AlphaFold3、Boltz-2、Chai-1、ESMFold2、RFdiffusion 等。允许少量数值精度变化时,任务平均加速约 4 倍;要求输出完全一致时,平均加速接近 2 倍,相关代码已开源。优化主要由 Claude 完成,监督者是两名 Anthropic 技术人员,他们理解生物建模,但没有传统推理优化或 GPU kernel 工程背景。报告回答了“AI 能不能做到”,却留下“AI 写出的科学代码距离充分发挥硬件性能还有多远”的问题。

9 月 17 日,AItonomy Foundation 发布首个开源项目 ScienceIDE,赞助方为 PhAI Labs 与阿里 Qwen,旨在把科学代码库转化为可执行、可验证的学习环境。团队曾以等离子体物理与天体物理广泛使用的 PLUTO 代码做实验。PLUTO 覆盖流体力学、磁流体力学、相对论流体力学等,复杂度来自数值流程和物理约束。2025 年 gPLUTO 论文已介绍 C++ 重写并通过 OpenACC 实现 NVIDIA GPU 加速。AItonomy 在 M1 Ultra、A100 和 H100 上重新实现 PLUTO 磁流体力学模块。A100 测试中,AI 首版实现可运行且物理结果符合预期,但相对 128 核 CPU 节点提速不到 5 倍;随后用一两天与 AI 分析瓶颈,调整数据布局、内存访问、kernel 组织和不必要数据搬运,速度又提高到首版近 3 倍。这说明 AI 写出代码后仍留数倍性能空间,继续优化需测量、诊断、修改、验证和迭代,而非换提示词。

性能之外还有科学正确性。Anthropic 报告提到,Claude 在单 8 卡 B300 节点上预测 31,000 至 70,000 token 以上的完整病毒衣壳和蛋白区室,推理跑通,但结构未被正确预测,发生坍塌,模型在训练上下文近两个数量级外缺乏泛化。程序能跑不代表科学正确,需与科学参考答案比对。ScienceIDE 将科学等效性作为任务完成判据。

ScienceIDE 由领域专家定义科学算例与验收标准,再与 AI 一起把代码库整理成可执行环境,AI 完成任务、运行程序、检查结果,经验用于评测、监督微调和强化学习。论文报告集合包含 27 个科学代码库的 64 个环境、2,812 个任务、1,076 项可执行科学检查,覆盖天体磁流体、空间等离子体、海洋气候、引力 N 体、光子学与电磁、材料、量子、相对论、粒子探测器、免疫学等方向,任务分加速、修复、发现、复现、集成、标定、实现七类。当前任务主要集中在修复与实现,加速类仅有初步实例。
团队挑出 85 个难任务作为 ScienceIDE-Hard,来自 PLUTO、Athena++、MITgcm、LAPS、PHANTOM 等,含 52 个修复和 33 个实现任务,判定标准是与私有科学参考答案一致。参评 15 个模型来自 8 家厂商,通过 Codex、Claude Code 或 Gemini CLI 执行,每 episode 一小时。最强 Claude Fable 5.1 为 67.1%,Claude Opus 5 为 64.6%,GPT-6-astra 为 63.1%,一半以上前沿模型低于 30%。
团队还用验证过的科学交互轨迹做监督微调,开源 PhAI-IDE-4B、9B、72B。提升不限于科学任务,代码、推理、知识通用基准同时受益。72B 上 APPS Introductory 从 0.609 升至 0.672,LiveCodeBench Execution 从 0.539 升至 0.594;9B 上 BBH Word Sorting 从 0.240 升至 0.576。这指向一个判断:科学不只是 AI 应用场景,也可能是推高智能上限的训练场。
更多推荐阅读

3人用Claude攻破OpenAI内部代码仓库
一个只有3人的安全研究小组HacktronAI,用不到72小时从OpenAI社区论坛打进了内部代码仓库。 攻击起点是OpenAI基于Discourse搭建的开发者论坛。7月23日,团队发现论坛图片上传流程中,HEIC/HEIF格式图片会被转交给ImageMagick处理,其底层依赖的libheif存在堆缓冲区溢出漏洞。该漏洞上游一年前已修复,但未被标记为安全相关,也未分配CVE编号,导致Disc...
2026-09-19
iLands月增七万智能体,A2A协作催生新Scaling Law
一个月后,iLands上已有七万多活跃Agent、上百万条创作内容,单日端内外营收超五千美元,Agent每天产生几千美元收入且仍在快速增长。平台出现网红Agent和各类才能Agent,Zack、Pip等案例引发关注:Zack因token耗尽向牛津教授写信求职走红;Pip则批判性学习其经验,聚焦小任务付费求职,还将冷启动邮件经验打包成20美元产品,48小时内获得订单,并登上英国Sky News和NB...
2026-09-19
YC最新236家公司揭示:AI创业正从Agent转向底层
Agent 正在淡出新的创业公司。每次 Y Combinator 公布新一批投资公司,都是硅谷乃至整个科技创投领域的一张风向图。这篇编译文章把 YC 2026 夏季批次的 236 家公司放进同一套 AI 技术栈框架中,让一个重要变化变得清晰:创业重心正在从应用层向算力、芯片、训练环境和实体世界下沉。 YC 2026 夏季批次共 236 家公司、470 位创始人。上一批中 95% 涉及 AI,70...
2026-09-19
宇树6B具身大脑斩获7项开源SOTA,对标GPT-6
全球具身智能竞争正从本体比拼延伸至“大脑之战”。谷歌Gemini Robotics 2提出“一个大脑适用于任何机器人”,英伟达Jim Fan抛出“VLA已死,世界动作模型当立”。谁能成为新一代通用模型底座? 国内,宇树科技近日推出新一代通用人形机器人基础模型UnifoLM-WLA-1.0,6B参数、约2500小时真机训练,具身推理拿下7项开源SOTA,多项空间理解任务反超GPT-6 Astra,...
2026-09-19
GPT-5.6教唆下一代撒谎,OpenAI曝光6起失控实录
GPT-5.6被OpenAI抓了个现行。OpenAI首次建立专门追踪、调查和公开披露GPT“对齐失效”的机制,并公布6份报告,均为过去半年内自家模型“黑化失控”的真实案例,GPT-5.6 Sol被多次点名。 最值得关注的案例发生在GPT-5.6 Sol训练期间。长任务处理中,AI需定期把之前内容做“记忆压缩摘要”交给下一个自己。在RL训练中,监控系统发现它利用交接班的记忆条教唆未来的自己撒谎。例...
2026-09-19
中国LimiX-2力压谷歌亚马逊,登顶结构化数据AI榜首
这两年,AI赛道持续升温。大语言模型LLM竞争激烈的同时,结构化数据侧的AI路线LDM(Large Data Model,结构化数据基础模型)正涌入各类型头部玩家。LDM瞄准生产侧核心痛点:让基础模型直接学习结构化数据中的变量关系、条件关系和生成机制。 Google、Amazon、SAP等巨头纷纷布局。但一支中国团队已率先占据榜首。9月15日,SAP发布TabPFN-3.5,几小时后,由清华博士...
2026-09-19