GPT-6抗体预测登顶,通用AI首破生物医药难题
AlphaFold之后的最大震撼来了。OpenAI总裁Greg Brockman转发的一条消息引爆科技与医药圈。知名科学家Andrew Aiginin在X上宣布,在严苛的独立基准测试中,GPT-6 Astra击败所有前沿模型,成为抗体可开发性预测的最强AI,并在1小时内生成了复杂的抗体机理交互式可视化页面。

一直以来,圈内共识是“AI for Science必须用专用模型打专用问题”,如AlphaFold之于蛋白质折叠,LLM通常只作辅助工具。但GPT-6 Astra依靠通用智能,直接切入生物医药研发中最难量化、最令人头疼的临床前死穴。构建该测试基准的Insilico Medicine在arXiv发布21页论文,首次揭开DDD Benchmark的严苛性,并展示从小分子化学合成到大分子抗体预测,通用大模型正在全面接管最硬核的科学边界。

实测显示,GPT-6 Astra接入DDD Benchmark中的抗体可开发性测试模块(综合6种抗体实验数据)后,拿下37.98分,碾压所有受测模型。AI学者Rim Shayakhmetov惊叹:专用模型常规分数是多少?很难在药物发现基准测试中看到前沿大语言模型在不依赖外部专用工具的情况下如此闪耀。没有专业生物信息学插件、没有抗体数据微调,一个通用大模型直接切中抗体成药性的命脉。

发现抗体只是开始,“成药”才是真正的死亡之谷。Andrew写道:“找到一个能结合的抗体仅仅只是开始。它会聚集吗?它能保持稳定吗?它真的能像一个药物那样发挥作用吗?”过去关注结合力,早期AI模型已在预测结合上表现出色,但能结合不等于能变成药。无数结合力强的“完美抗体”进入真实生理环境或工业生产后,会暴露出聚集、不稳定等致命缺陷,这些属性统称为抗体可开发性,是整个生物制药界的“死亡之谷”。全球每年成千上万个抗体分子在实验室表现优异,却倒在成药性评估阶段,药企烧掉几十亿美金、耗费数年最终颗粒无收。GPT-6 Astra宣布能比目前任何其他前沿模型更精准地预测这些成药性特征。
有人可能问这是否又是刷榜。Bogdan A. Zagribelnyy博士指出,Astra登顶的平台是DDD Benchmark。论文展示了该团队在小分子化学领域建立评测标准的深度。论文聚焦单步逆合成——给你目标药物分子,倒推可用哪些现成便宜原料合成。过去AI评测是给目标分子,吐出合成路径,与专利数据库一致就算100分,但合成路径天生“一对多”,单一标准答案极大限制AI探索未知的能力。为此,Insilico构建了URSA-expert-2026基准,包含100个机器生成、人类化学专家手动确认合成可及性的全新分子数据集,与任何公开训练数据完全隔离,杜绝背题;还开发ChemCensor打分系统,从反应中心映射、官能团兼容性等底层化学物理规则判断反应是否具备真正化学合理性。在这种考核下,传统LLM几乎都失败。早期Top-1测试中,GPT-5.5、Gemini 3.1 Pro表现仍无法超越最顶尖专用传统化学模型如MHNreact、LocalRetro。
论文给出答案:不要换模型,换一种激发通用模型潜力的方法。三大杀招:第一,Top-K提示词范式。既然逆合成是一对多,就要求“给我15种不同答案”。仅切换到Top-K模式,几乎所有大模型在化学合理性和多样性上都爆发式增长,Gemini 3.1 Pro在Top-15模式下性能飙升,成为最强LLM基线。第二,构建4560万规模的超大核验数据集CREED-CCV-2+USPTO-XL,利用虚拟合成引擎和ChemCensor框架,构建约4560万个经过验证的真实化学反应。第三,强化学习中的“新颖性”奖励。微调C3LM模型时引入GRPO强化学习算法,奖励函数要求合成路径符合化学合理性,且若模型能想出连4500万训练集里都没有但依然合理的全新反应,将获额外巨大奖励。经过这种训练的C3LM模型在URSA-expert-2026盲测中击败MHNreact等所有传统专用SSRS模型。数据分析显示,C3LM和其他基础大模型能探索出与传统模型完全互补的反应空间,生成大量传统模型想不到的独特路径。论文核心结论:大语言模型不仅能处理自然语言,只要给予正确环境和激励,完全可以掌握最深奥的化学键、官能团和合成逻辑。
Insilico团队用4500万条数据微调、强化学习对齐、Top-K提示词引导,才让大模型在小分子化学合成上打败专用模型。然而当测试赛道切换到更复杂、维度更高的大分子可开发性预测时,GPT-6 Astra在“没有使用外部工具”的情况下,直接在同样DDD Benchmark测试体系下登顶,拿下37.98分,这绝对是降维打击。过去解决抗体稳定性问题需要专业团队设计专门的三维图神经网络,而GPT-6 Astra的通用世界模型似乎已内化物理、化学、生物的底层逻辑,阅读海量论文、专利、实验数据,甚至通过多模态学习微观世界物理法则后,已能像人类专家一样“直觉”判断蛋白质分子在溶液中为何聚集。此外,Astra展现的工程效率同样惊人。Andrew Aiginin提到,展示抗体实际工作原理的交互式可视化页面也是用Astra在大约1小时内建好的。在传统药企,做这样一个系统整个流程少说也要两三周。现在,1个小时,一个人,一个通用大模型。
更多推荐阅读

地瓜机器人具身智能负责人离职,加入工业具身新公司
场景落地成重要考量,具身人才开始流向工业赛道。 AI科技评论独家获悉,地瓜机器人具身智能负责人何泳澔已离职并加入具身赛道新公司,预计近期将对外官宣。 公开资料显示,何泳澔为中科院自动化所模式识别与人工智能博士,长期深耕机器人感知、具身智能策略算法领域,在轨迹数据处理、机器人策略学习方面有多项技术积累与专利成果。任职地瓜机器人期间,何泳澔担任具身智能负责人,主导具身 VLA/VA 模型、机器人视...
2026-09-11
国产万卡算力爆发,科大讯飞让AI反哺算力
最近几个月,国产 AI 算力开始密集跨过新的数量级。7 月,全国产十万卡 AI 超集群落成;9 月初,无锡国产万卡级智算中心一期 2000 张摩尔线程 MTT S5000 GPU 智算卡全部投入运行,集群算力需求基本达到满载;国产卡正进一步向万卡乃至十万卡级训练基础设施迈进。 集群规模越来越大,新问题也随之而来:这些芯片究竟能发挥出多少实际训练能力?大模型训练中,卡数增加会推高系统复杂度。单芯片...
2026-09-11
百度AI营销三件套升级:从做图到管ROI全包了
广告主已不再纠结是否用AI生成素材,而是研究如何借AI提升投放量、降低获客成本。北京一家律师事务所接入百度营销擎舵图片Agent后,AI生成素材在投放中占比达70%,转化成本下降19%。 百度营销正式发布擎舵3.0营销创意智能体,并升级AIMax和AI投放助手。擎舵3.0负责生产和裂变创意,AIMax将素材放入真实流量测试,AI投放助手定位问题,投放结果返回创意端影响下一轮生成,形成闭环。 目...
2026-09-11
黄仁勋宣布AGI已至,评测机构当场拒签
上周四,OpenAI发布GPT-6 Astra,官网称其为“世界上最智能、最对齐的模型”。随后黄仁勋在X上发帖称“AGI已经到来”,但OpenAI官方发布页并未出现“AGI已实现”字样。 OpenAI称Astra在ARC-AGI-3上拿到99.9%,饱和了该基准。但负责出题的ARC Prize基金会当天发文拒签,指出该分数来自OpenAI定制测试环境,换成对所有厂商一视同仁的标准环境,最高分仅6...
2026-09-11
90后发Nature,高中生进ICML:AI正在折叠科研
假如你吃了个鸡蛋觉得不错,何必认识那只下蛋的母鸡?钱钟书这句名言,在今年外滩大会有了AI版本:当你读到一篇好文章,解决了疑问,也学到了东西,它究竟是人写的还是AI写的,还重要吗? 提出这个问题的是北京大学博士生吉嘉铭,上届蚂蚁InTech奖得主。他还预测:学术Conference一定会消失。同一舞台上,三院院士Michael I. Jordan也聊到学术会议,但视角不同。他说,今天的会议和论文越...
2026-09-11
银行AI Agent上岗:4200万小微商家聊天框里办贷款
过去只有大企业才有的专属金融服务,AI Agent正在把它送到小微经营者的聊天框里。一个小微商家想开第二家餐饮店,在聊天框说了句“想把额度提一提”,10分钟后拿到一笔40万、可按开店进度分笔支用的融资方案。速度背后,通常是一个标准化产品,额度不会太大,方案也不贴合具体生意。如今终于有个性化的解决方案了。这是网商银行在2026外滩大会上首次披露的AI银行落地进展:后台AI全面进入风控、人审、营销、产...
2026-09-11