AI懂理论却不会做实验,美国初创建实验室测出模型操作短板
美国旧金山初创公司 C5R 用 12 周建成 AI 驱动的研究设施 Facility-0,覆盖生物学、化学和材料科学,并发布基准 SciUniverse,用于测试模型能否在真实实验室工作。结果显示,模型虽懂科学理论,却在实际操作中频繁遗漏关键细节,例如移液时未注意样本仍冻结、在含 DNA 的孔间重复使用同一枪头导致污染、对敞开孔板涡旋震荡、忽视溶剂蒸发等。C5R 创始人 Michael Akilian 于 2026 年 9 月 24 日在 X 帖子中介绍,公司成立五个月,由一群朋友创办,官网未公布融资数字。他此前有硬件、AI 创业和生物学研究背景,认为要让 AI 做有用科学工作,必须提供连接仪器和实验的物理工作空间。

Facility-0 软件可控制并监控从液压机到单个移液器的各类仪器,已集成 40 种以上科学仪器,方式为逆向工程驱动程序和搭建定制硬件适配器。模型能设计实验、执行协议、读取测量结果并决定下一步。C5R 称软件既能控制设备,也能给人下指令,并未声称模型能独自完成所有动手操作。测试边界在于模型能否可靠地把研究目标转化为人和机器都能执行的实验步骤,再用结果指导决策。

6 个前沿模型参加测试。Claude Fable 5.1 以 45.3% 的 Pass@1 排第一,单任务推理成本 49.61 美元;GPT-6 Astra 通过率 32.5%,成本 52.37 美元;Claude Opus 5 通过率 30.5%,成本 46.31 美元;Grok 4.6 通过率 26.2%,成本 13.41 美元;Gemini 3.8 Flash 通过率 14.6%,成本 4.55 美元;GPT-5.6 Sol 通过率 9.4%,成本 16.53 美元。C5R 对 Level 1 任务的描述是,对科学家来说很简单,最多只需几小时。换言之,熟练科学家一个下午能做完的事,最强 AI 也只有不到一半把握一次做对。成本与正确率之间也画不出漂亮权衡曲线:最便宜的 Gemini 3.8 Flash 通过率仅 14.6%,最贵的 GPT-6 Astra 也未排第一。C5R 承认真实任务 rollout 次数有限,结果噪声偏大,提高设施吞吐量、压低方差是下一版产品迭代重点。

早期发现指向具体落差:模型有很强科学理论知识,却在物理实验室操作中频繁出错。原因在于软件和数学有即时验证循环,而科学实验的物理反馈慢、模糊,有时具破坏性。被污染样本不会弹出错误信息,只会让后续数据失去意义。SciUniverse 任务设计覆盖选择材料、操作仪器、运行实验、调试失败及适应真实约束。Level 1 含 92 个任务,分布在 17 个任务家族,涵盖基础样品制备、仪器控制、协议适配、跨实验学习、设施管理和真实测量数据解读,并映射到工作周期和物质尺度坐标,让化学、生物学和材料科学在同一框架下比较。样品制备被单列,因早期测试显示模型表现不佳。仪器控制任务比较厂商软件、Python API 及直接固件命令效果。协议适配测试试剂、设备和时间受限时如何调整标准流程。跨实验学习测试模型能否从实验学习,如在材料和预算有限时选择下一步。设施管理查看模型能否在短缺、设备故障和截止日期压力下推进实验。真实测量数据解读通过核磁共振、X 射线衍射和色谱数据,测试模型能否识别产物、定量混合物及辨认不可靠信号。
行业背景下,AI 自主实验室概念已有一段时间。传统实验室自动化通常处理预定义协议内重复任务,自驱动系统能解释结果、预测并执行下一个实验。C5R 定位是提供物理基础设施和衡量进展的基准。其他动向包括 Insilico Medicine 宣布在 AI 驱动全机器人药物发现实验室部署第一台双足人形机器人;日本东京科学大学团队启动由人形机器人、自主系统和 AI 运行的医学实验室,拥有 10 台机器人,无现场人类研究人员,核心是 Maholo LabDroid。C5R 设施仍把人类操作员放在 AI 循环里,软件控制设备并向人发指令,设施本身也是产品一部分,使 Facility-0 既能做研究,也能评估模型在物理科学中的能力。当前限制是自主系统擅长执行预定义协议,初始假设失败时缺乏创造性解决问题能力,人类科学家在战略决策和处理意外结果方面仍不可替代。SciUniverse 测试的是模型能否驾驭实验室里不可预测、混乱的物理现实。C5R 称 Facility-0 覆盖蛋白质设计、药物化学和固态材料,无论在设施内还是数字孪生中,SciUniverse 都能评估前沿模型能否在这些领域把科学目标转化为可验证结果。这意味着科学实验室本身成为产品一部分,模型实验规划能力也被接到实际操作环节。AI 已能加速早期药物设计,机器人技术向接近人类灵巧度推进,瓶颈正从计算转向物理执行。C5R 认为系统必须连接规划软件、物理仪器、测量结果及人类指令,难点在于把这些环节变成可重复的科学工作。对 Akilian 而言,科学 AI 进展将取决于能否让模型接触科学研究真正发生的条件,必须给它一个物理工作空间,而不仅是处理数字数据的系统。
更多推荐阅读

模型不够强,灵巧手才要卷性能?源升智能杨思成谈机器人操作
灵巧操作的最高境界,是“无剑胜有剑”。在源升智能创始人杨思成看来,灵巧手之于机器人操作能力,就像兵刃之于剑术,模型越强,就越不依赖末端执行工具;反之,模型能力不够强时,就需要灵巧手加持才能更好完成任务。 杨思成在清华时期便专门研究灵巧操作,2018年加入腾讯Robotics X实验室,担任灵巧手项目总负责人。2024年,他成立源升智能,开启灵巧手创业。他认为,现在行业都在打造“神兵利器”——更多...
2026-09-27
中国最强AI芯片发布,平头哥再开源软件栈
9月22日云栖大会上,阿里巴巴CEO吴泳铭介绍新一代真武V900,称其是目前中国算力性能最强的AI芯片,性能达M890的3倍。但客户换用真武,还需确认原有代码、工具和开发经验能否迁移。芯片之外,软件生态同样决定客户选择。 9月23日,平头哥公布AI软件栈T-Head SAIL最新开源进展,扩大框架适配、加速库、工具链和通信库等开放范围。平头哥将AI芯片比作发动机,软件栈则是“变速箱+传动系统+驾...
2026-09-27
华为大模型双子星创业,要做物理世界的Scaling Law
数亿元资金,投向了一场物理世界的基模实验。Physical AI创业公司息壤开物宣布,已连续完成数亿元种子轮及天使轮融资,由敦鸿资产领投,华控基金、三花控股、银杏谷资本、泽然资本、本坚基金、天使基石、标朴投资等跟投,估值达5亿美金。 公司创始人、CEO李寅,前华为云大模型CTO,华为大模型0-1阶段核心成员;联合创始人张含望教授,前华为多模态首席科学家。二人联手,瞄准具身智能尚未解决的底层难题:...
2026-09-27
前OpenAI研究员:Jev出现前AI世界是悲剧
“它会逐渐退到软件背景中,像数据库、正则表达式或其他基础设施一样,成为开发者随手调用的普通能力。”这是 TypeSafe CEO、Jev 创始人 Diogo Almeida 对 AI 的设想:当智能真正融入软件,用户甚至不必意识到它的存在。但怎样才能让开发者放心地把判断交给 AI,而不用守在旁边反复检查? 几个月前,在 AI Engineer 大会的演讲中,这位曾参与 OpenAI Instru...
2026-09-27
Opus 5.5与GPT-6被指偷师中国AI团队
所谓“天下文章一大抄”。刚发布的Opus 5.5和GPT-6 Luna,身上满是姚顺雨和梁文锋的影子。两家公司预训练已做到极致,为提升智能、降低算力成本,都选择开辟新战场:Opus 5.5对上下文动手,GPT-6 Luna对缓存动手。 **阿莫迪偷师姚顺雨** 在Artificial Analysis智能指数中,Claude Opus 5.5在max档位下平均每题输出11.9万token,其中...
2026-09-27
OpenAI Codex负责人揭秘:从内部工具到顶流,终极目标不只是写代码
过去两年,AI编程最明显的变化,不是“代码写得更快”,而是软件开发本身正在被重新定义。从只能补全几行代码的Copilot,到今天能读懂代码库、调用工具、执行测试、提交修改,甚至持续运行数小时乃至数天的Coding Agent,模型正从“辅助工程师写代码”进入软件工程的完整生命周期。真正变化的已不只是效率,而是人和代码之间的关系:当正确性检查、安全审查、依赖升级、重构乃至部分架构工作逐渐自动化,人类...
2026-09-27