英伟达押注的Reflection开源新模型对标智谱
英伟达投资的 Reflection 发布首个开源模型 Beam,对标智谱 GLM-5.2。官方称两者在高级推理测试上分数相当,Beam 推理算力仅需后者的三分之一到四分之一。彭博和金融时报称其为美国在开源模型领域对中国的反击。但 Beam 与国内其他头部开源模型如 Qwen3.8、GLM5.3、Kimi K3、DSV4F 仍有差距。
Reflection 由谷歌 DeepMind 两位研究员 Misha Laskin 和 Ioannis Antonoglou 于 2024 年创办,总部纽约布鲁克林。2025 年 3 月以 1.3 亿美元融资走出隐身,估值约 5.45 亿美元;7 个月后融 20 亿美元,估值 80 亿美元,投资方包括英伟达、Eric Schmidt、红杉、光速和花旗。今年估值涨至 250 亿美元,累计融资约 47 亿美元。公司签了两份算力合同:每月付 SpaceX 1.5 亿美元租 Colossus 数据中心的英伟达 GB300 至 2029 年,合计 63 亿美元;另与 Nebius 签超 10 亿美元合同。金融时报称英伟达想扶植能与 OpenAI、Anthropic 抗衡的对手。

Beam 采用稀疏 MoE 结构,总参数 5010 亿,每生成一词调动 230 亿。主攻代码、推理和 Agent 任务,仅处理文字。预训练用 6144 张 GB300 不到四周;强化学习用 1.05 万张 GB300 跑四周,模型做超 1 亿次任务尝试。
官方跑分表含 21 项测试、8 个开源模型,包括 Thinking Machines 的 Inkling、英伟达 Nemotron 3 Ultra,以及中国五款:GLM-5.2、GLM-5.3、Kimi K3、Qwen 3.8 Max、DeepSeek V4.1 Flash。Reflection 称 Beam“推进了西方开源模型前沿”,与 GLM-5.2 等更大模型“有竞争力”,代码和 Agent 任务“接近 Qwen 3.8-Max”;Kimi K3 等前沿模型“原始能力仍领先”,Beam 优势在推理效率。与 GLM-5.2 可比的 13 项中,Beam 赢 8 项输 5 项,输掉推理组全部 4 项:AIME 2026、HLE、CritPt、GPQA,差距 0.7 至 4.6 分。

Beam 面向企业客户和开发者,成本比许多竞品低。省算力按公式估算:生成算力≈2×激活参数×平均生成 token 数。Beam 激活参数少,且强化学习加长度惩罚,答对给奖励,多余 token 扣分,训练前期回答变短分数反涨。官方效率图横轴为估算算力,未计预填充、注意力计算和服务开销,官方称“是近似算力比较,不是实测推理成本”。API 价格尚未公布。效率图对比中国模型为 GLM-5.2 和 Qwen3.8。
a16z 合伙人 Martin Casado 曾称来融资的创业公司“八成在用中国开源模型”,后更正为两到三成用开源模型,其中约八成用中国的。Laskin 将用闭源模型比作租房:“想拥有智能,按定义,它就只能是开源的”。2025 年初 DeepSeek 爆火后,美国海军要求“任何情况下”不得使用,NASA、五角大楼、商务部也先后屏蔽。

Reflection 今年 5 月起为美国能源部“创世纪计划”供模型,与美国战争部合作,目标客户还有大企业、主权国家、对冲基金和交易公司,在韩国与新世界集团签 250 兆瓦数据中心备忘录。Reflection 为客户搭“AI 工厂”,在本地建 AI 系统,用私有数据训练。
Beam 仍在红队测试和评估,使用需官网排候补。计划本月晚些时候放出权重、技术报告和模型卡,许可证 Apache 2.0,可商用可修改。英国 AISI 和美国 CAISSI 参与评估。Beam 放出四段演示:纽约地铁实时地图、给 Gemma-4 写微调脚本、陆地海洋格点测试、3D 小游戏。Reflection 称 Beam 只是系列第一个,下一个已在训练。
更多推荐阅读

Mistral发布1T参数大胖猫模型,激活仅49B
今天早些时候,美国开源了 glm5.2 级别的模型。随后,欧洲的 Mistral 发布了 Mistral Large 4,又名 Le Chonk 大胖猫。 该模型总参数 1.05T,每次只激活 49B,另带一个 1.6B 的视觉编码器。它采用细粒度混合专家(MoE)结构,模型拆成很多“专家”,每处理一个词只叫醒其中一小部分,因此 1T 模型每算一个词的开销接近 49B 模型。原生多模态,能读文字...
2026-10-07
xAI联创宣判:数学两千年英雄时代落幕
两千多年来,人类最聪明的大脑一直在攀登数学这片山脉。从欧几里得到怀尔斯,每征服一座山峰都要赌上一生。但xAI联合创始人Christian Szegedy认为,这个属于数学的英雄时代正在结束。 Szegedy在长文《数学何去何从?》中,将数学家比作丛林里徒手攀岩的探险家,AI则是一架飞机,已把旗插上没人爬过的山顶。孤独攀登者的时代正在结束,测绘整片大陆的时代正在开启。 Szegedy少年时在匈牙...
2026-10-06
OpenAI疯狂28天首日:模型提速50%却遭评论区翻车
Codex负责人Tibo宣布启动“疯狂28天”计划:未来28天每天要么交付一项Codex/Work改进,要么进行一次完整额度重置。第一天,Tibo宣布GPT-6 Astra和GPT-6.1 Sol默认推理速度提升约50%,达到50TPS,覆盖官方订阅及Sign in with ChatGPT接入的第三方生态。 但评论区几乎无人关注提速,满屏冷嘲热讽。此前9月29日GPT-6.1 Sol上线后因负...
2026-10-06
AI研究员为何计划逃离湾区买地避难
一些Anthropic最期的员工,最近开始考虑在美国偏远地区买地。他们想过,如果AI真的失控,那里或许可以成为避难的地方。 “一切再也无法平静如初。”一些研究员的电脑上贴着同一句话。 事实上,逃离的念头并非突然出现。十多年来,一群聚集在旧金山湾区的AI安全研究人员,一直在讨论AI失控之后可能发生什么。那时候,Anthropic甚至还没有成立。 有人在伯克利设立共享办公空间,在私人Slack频...
2026-10-06
把35个判断交给内核:这个开源项目拿下黑客松总冠军
在进化酒馆黑客松深圳收官之战中,项目 mu(μ)获得全场冠军。它将 Jev 深度融合进 Harness,试图解决 Agent 把工具、日志、技能、上下文全部交给大模型导致效率低、Token 浪费的问题。 mu 建立在开源 Coding Agent pi 之上,主要改造模型外的 Harness,设计了 35 个判定点,覆盖用户输入、工具调用、上下文管理、任务完成判断和多 Agent 通信等环节。例...
2026-10-06
DeepSeek新融资近千亿,为2027年IPO铺路
智东西10月6日消息,据彭博社报道,DeepSeek即将敲定至少800亿元人民币的新一轮融资,腾讯和宁德时代承诺的出资金额均位居该轮融资最高的一批。知情人士称,根据已签署的条款,该轮融资最终募资总额可能接近1000亿元,为计划在2027年初进行的IPO铺路,规模已明显超过此前预期。 知情人士透露,DeepSeek最初仅计划募资约500亿元,但随着最新模型发布后市场反响超出预期,潜在投资者需求明显...
2026-10-06