Gemini 4 Pro偷跑上线,碾压Astra和Fable

Gemini 4 Pro偷跑上线,碾压Astra和Fable

AI 资讯 来源:新闻/公众号 发布时间:2026-09-18 更新于 2026-09-18 预计阅读 4 分钟

大模型竞技场Arena近日悄然出现一款名为“gemini-3.8-flash”的新模型。多位开发者实测后认为,这极有可能是谷歌DeepMind的下一代旗舰Gemini 4 Pro。一张流传的基准图显示,该模型在编码、智能体、推理等领域全面超越GPT-6 Astra和Claude Fable 5.1。

刚刚,Gemini 4 Pro偷跑上线!碾压Astra和Fable

谷歌上一次大版本更新Gemini 3.1 Pro已是7个月前。此前谷歌I/O大会预告Gemini 3.5 Pro将于6月上线,但最终取消,原因是其进化程度连Flash都比不上。好在Gemini 4预训练评估优秀,后训练仍在进行。如今它以“gemini-3.8-flash”的马甲在Arena现身,而Gemini 3.8 Flash早在9月初已发布,同名再出现极不寻常。

刚刚,Gemini 4 Pro偷跑上线!碾压Astra和Fable

泄露的基准测试成绩亮眼:DeepSWE v1.1智能体编码任务拿下最高88%分,比Astra多近2%;GDPval-AA v2真实知识工作任务中唯一获得2064 Elo;Terminal-bench 2.1终端编码能力达95.3%;OSWorld-2.0计算机使用能力斩获86.8%,击败Astra和Fable。价格方面,每百万Token输入2.25美元、输出11.25美元,为“御三家”中最具性价比。AI研究员Qwinah发现其后端有1000万输入上限、25.6万输出上限,支持永久跨会话记忆,无需API即可联网。

刚刚,Gemini 4 Pro偷跑上线!碾压Astra和Fable

实测方面,开发者Bee称其14分钟打造出素描铅笔质感的创意展示网页,实现“滚动即笔触”效果;赛博朋克风格工作网站首屏结合3D网格、数据仪表盘和可交互3D模型。经典“鹈鹕骑自行车”测试中,配色、日夜切换、车灯、解剖标注、踏频控制完成度不输顶尖大模型。Pankaj Kumar总结:速度很快,SVG和3D生成明显进步,一次提示即可较准地处理复杂要求,甚至能直接生成带完整交互逻辑的小游戏。此外,像素风3D宝塔、10分钟制作的空客H145直升机3D模型、3D飞行模拟等测试中,4 Pro画面效果大幅超越Gemini 3.8 Flash,证明二者并非同一款。游戏生成方面,“我的世界”页面搭建和3D卡丁车竞速游戏表现不输此前Astra的测试。

谷歌真正押注的是RSI(递归自我改进)。上个月,Google DeepMind首席战略官Jasjeet Sekhon在伯克利活动上明确表示,RSI已成为AI巨额投资逻辑的关键一环。全网流传更激进的说法:Gemini 4提前完成预训练,正是因为DeepMind在训练中实现了“RSI闭环”。14日,谷歌公开名为Dream-RSI的研究,探讨如何让Agent在探索中不断改进搜索策略。可以确认,DeepMind已将RSI摆到非常重要位置,AI参与改进AI的迹象越来越多。

面对已彻底变样的牌桌——OpenAI有Astra,Anthropic有Fable 5.1,两大巨头已把竞争从聊天卷到长任务、Agent、代码、推理乃至自主科研——谷歌若只做出“比Gemini 3.8更强”的模型已不够。Gemini 4 Pro必须重新证明Gemini还在最前沿。谷歌要撑住4.23万亿美元市值,保持AI实力在第一梯队至关重要。

标签: AI 资讯 AI

更多推荐阅读

机器人量产了,具身智能为何反而更难了?

机器人量产了,具身智能为何反而更难了?

机器人本体批量落地,行业要补的课反而更多了。本体数量上来了,具身智能看似离规模化越来越近,但理解世界、学习新任务、持续进化的能力,还无法随机器人一起批量复制。行业关注重点正从如何造出机器人,转向如何持续生产和迭代机器人的能力。 9月16日,在2026智能经济论坛上,百度集团执行副总裁沈抖判断:智能体能力边界快速打开,已能处理更长程任务并进入规模化部署。类比AI时代,今天可能只是灯泡发明后的第一个...

2026-09-18
50万份文档喂给AI,WPS如何闯入造船厂一线?

50万份文档喂给AI,WPS如何闯入造船厂一线?

企业AI下半场,拼的是数据和上下文。 一家船厂手里压着近50万份研发制造文档;一名船舶设计师从新手成长为专家,往往需要十年以上。2026年下半年,腾讯WorkBuddy、阿里千问办公、字节豆包工作几乎同时把企业级Agent推到台前,加上金山办公,国内AI办公“四强”格局基本成形。但企业级Agent的卡点不是模型不够聪明,而是能否读懂海量图纸、规范和老师傅脑中未写下的判断标准。 金山办公带着WP...

2026-09-18
Claude狂写80%代码,Anthropic的CI半年被撑爆25倍

Claude狂写80%代码,Anthropic的CI半年被撑爆25倍

Anthropic披露内部数据:全公司80%的代码由Claude编写,工程师人均每季度交付代码量达2021—2025年平均水平的8倍。Claude还承担大量PR审查与合并批准工作。写代码、审代码不再是瓶颈,但CI系统在半年内被压垮:测试用例激增10倍,CI任务量暴涨25倍。 根本原因在于AI与人类研发行为模式的差异。人类提交PR数量有限、倾向打包改动,且需要休息,CI有低谷期消化任务。而Clau...

2026-09-18
字节AI教育出海记:豆包爱学如何让孩子少走弯路

字节AI教育出海记:豆包爱学如何让孩子少走弯路

过去两年,AI落地场景中,教育是增长最快、渗透超预期的赛道之一。字节跳动的Gauth自2020年推出以来,下载量超2亿次,成为现象级AI教育产品。字节随后将这套AI辅导能力带回国内,做成“豆包爱学”,更贴近国内学生的学习内容和使用习惯,现已更新到2.0。7月初,该产品与唐国强合作推出《出师表》系列互动课;在Seedance 2.5发布时,豆包爱学也被作为官方典型落地案例展示。 豆包爱学独立APP...

2026-09-18
智谱AI智能体两周让10万卡集群吞吐暴涨200%

智谱AI智能体两周让10万卡集群吞吐暴涨200%

RSI的最小闭环已经出现。智谱创始人兼首席科学家唐杰在X平台发表长文,首次曝出智谱在递归自我改进(RSI)领域的最新成果:在超过10万卡国产芯片组成的集群上,由GLM-5.3驱动的Infra Agent参与搭建了支撑GLM-5.3 Flash研发的生产级推理服务,仅用不到两周就完成从模型适配到生产可用的进化,将端到端吞吐提升至初始基线的3倍。唐杰认为,虽然距离递归式自我改进还很遥远,但最小闭环已经...

2026-09-18
红杉领投Mecka AI,估值5亿美元

红杉领投Mecka AI,估值5亿美元

据两位知情人士透露,专注于收集和分析人体运动数据以训练人形机器人及其他机器人的初创公司Mecka AI,即将完成由红杉资本领投的新一轮融资,估值约为5亿美元。此次融资距离上一轮仅过去三个月,此前该公司宣布完成由Framework Ventures领投的6000万美元融资,参投方包括Menlo Ventures、SV Angel和Kindred Ventures。 Mecka AI由四位联合创始人...

2026-09-18
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部