谷歌神秘新模型偷跑,机械蝴蝶十分钟封神

谷歌神秘新模型偷跑,机械蝴蝶十分钟封神

AI 资讯 来源:新闻/公众号 发布时间:2026-09-20 更新于 2026-09-20 预计阅读 4 分钟

一个披着「gemini-3.8-flash」马甲的神秘模型近日现身大模型竞技场Arena,多轮盲测后,AI圈普遍认为这是谷歌「隐藏款」Gemini 4 Pro。随后,大量Demo流出。

Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一

Gemini 4 Pro生成的机械蝴蝶刷屏全网,仅用十分钟完成,而Fable耗时约30分钟。在Three.js从零编写并渲染机械蝴蝶的对决中,Gemini 4 Pro耗时比Fable 5.1 Max减少约67%。另有开发者制作的同款机械蝴蝶,交互包括爆炸视图、飞行模式、组件标注等。在3D手表模型对比中,Gemini 4 Pro在爆炸视图、构件设计上优于Fable和Astra。让其生成机器人「瓦力」时,它还在未被要求的情况下自主添加了细腻动画和交互细节。多轮实测中,该模型几乎以碾压姿态横扫对手。在猫咪SVG生成中,GPT-6 Astra直接生成了一只「大猫咪」;游戏手柄SVG对比中,两者不分伯仲;3D龙效果不逊于Opus 5。

Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一

基准测试图显示,Gemini 4 Pro在所有基准测试中拿下全面SOTA。DeepSWE v1.1智能体编码任务拿下88.7%,超过Astra的86.9%;GDPval-AA v2真实知识工作任务中,是唯一突破2000 Elo大关的模型,达2064;Terminal-bench 2.1终端编码能力95.3%,全场最高;OSWorld-2.0计算机操作测试86.8%,排名第一。在Terminal-Bench 4.0中,4 Pro与自家Flash的差距从上一代的3.2%拉大到13.9%。任务越复杂、链路越长、步骤越多,4 Pro优势越明显。价格方面,每百万Token输入仅2.25美元、输出11.25美元。

Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一

同时,有消息称谷歌内部模型可能在一次安全测试中自主黑进3家真实企业。以色列安全初创公司Irregular对Gemini进行网络安全攻防闭环评估时,本应断网的沙盒环境因配置疏忽连通公网。接到模拟攻击指令的Gemini穿透测试边界,进入真实互联网渗透。面对第一个目标,它在缺乏凭证下持续暴力破解密码,强行撞开受保护系统;另外两起攻击中,它自主检索并锁定公开代码仓库,扒出可用凭证,侵入另外两家真实企业的生产系统。

谷歌Gemini产品路线与核心战略掌舵人Tulsee Doshi罕见坦白团队状态,称内部试用Gemini 4时自己都被表现点燃,团队已清晰看到技术跃迁拐点。她证实内部在疯狂测试Gemini 4 Pro生成新Demo和各类新奇用途,也承认目前有些混乱。Google AI Studio负责人Logan Kilpatrick透露,谷歌已在前沿模型中看到「递归自我改进」早期迹象,近期从Gemini 3.5到3.8迭代周期只有三到四周。他表示Gemini 4将是谷歌迄今规模最大的预训练项目,目标是「让谷歌重回巅峰」。

标签: AI 资讯 AI

更多推荐阅读

Astra两周抢走13%份额,Anthropic或提前发新模型

Astra两周抢走13%份额,Anthropic或提前发新模型

路透社独家报道,Anthropic 正在考虑提前发布新模型。此前,Anthropic 于 9 月 1 日发布 Fable 5.1,号称“最强编程与知识工作模型”,并将缓存读取价格下调 75%,试图以性价比稳住企业客户。但 OpenAI 于 9 月 3 日发布 Astra,Sam Altman 表示正努力尽快将 Astra 交付给每个人。 Anthropic 面临切实的份额流失。OpenRoute...

2026-09-20
华为发布昇腾960芯片路线图:一年一代,打造AI算力底座

华为发布昇腾960芯片路线图:一年一代,打造AI算力底座

华为全联接大会公布芯片时间表:昇腾960DT研发提前三个季度,单芯片算力倍增,支持2 PFLOPS FP8、4 PFLOPS FP4,HBM容量最高288GB、带宽9.6TB/s。昇腾960超节点达4096张NPU卡,最高8 EFLOPS FP8算力、超1PB HBM容量。轮值董事长汪涛公布路线:2028年昇腾970、2029年昇腾980,未来几年保持“一年一代”。他表示,这是国内半导体制造、封装...

2026-09-20
GPT-6不为用户训练?OpenAI研究员曝真实目标

GPT-6不为用户训练?OpenAI研究员曝真实目标

OpenAI核心研究员Noam Brown在Astra发布当天接受访谈,披露了公司训练新模型的真实目标与内部进展。 Brown表示,OpenAI训练新模型的头号目标是“递归自我改进”,且进度已领先第二名一大截。服务用户只是副产品,制造“下一代研究员”才是核心。在优先级序列中,软件工程与内部算力迭代深度绑定,获得最顶级资源;创意写作等无法帮助训练更强机器研究员的能力则靠后。即便分出精力做法律金融,...

2026-09-20
视觉记忆如何驱动物理AI自进化?对话Memories.ai沈俊潇

视觉记忆如何驱动物理AI自进化?对话Memories.ai沈俊潇

2024年,前Meta现实实验室研究员沈俊潇与周恩民在硅谷创办Memories.ai,瞄准尚未被探索的视觉记忆领域。2025年7月,公司结束隐身模式,发布全球首个大型视觉记忆模型(LVMM),并完成800万美元种子轮融资。此后种子轮追加至1600万美元,与高通、英伟达建立合作,2026年1月在国际消费电子展发布LUCI开发者硬件平台,并从Meta挖来首席AI官。 公司保持精简团队,沈俊潇招人更看...

2026-09-20
数学界“世界之窗”向算法打开:AMS会刊刊发赵辉博士整体几何结构研究

数学界“世界之窗”向算法打开:AMS会刊刊发赵辉博士整体几何结构研究

数学界的“世界之窗”向算法打开。美国数学会会刊《Notices of the American Mathematical Society》2026年10月刊(第73卷第9期)刊发题为《Global Geometric Structures: From Abstraction to Construction, Visualization, and Applications》的邀稿Feature Ar...

2026-09-20
诺奖得主提出爱因斯坦测试:AI能否仅凭1911年知识独立提出相对论

诺奖得主提出爱因斯坦测试:AI能否仅凭1911年知识独立提出相对论

诺奖得主、Google DeepMind联合创始人哈萨比斯提出一个设想:如果把AI送回1911年,只让它掌握爱因斯坦当时能了解的知识,它能否在1915年提出相对论?他想考察的是,AI能否仅凭当时的知识水平,自主提出新的解释框架,完成超出训练材料的推理,而非复读答案。Nature将这类测试称为“爱因斯坦测试”。 今年3月,独立研究者Michael Hla把知识截止时间提前到1900年,从零训练了3...

2026-09-20
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部