Gemini 4发布:重写80万行内核,成本仅对手六成

Gemini 4发布:重写80万行内核,成本仅对手六成

AI 资讯 来源:新闻/公众号 发布时间:2026-10-01 更新于 2026-10-01 预计阅读 5 分钟

谷歌正式发布新一代前沿AI模型Gemini 4 Argon,这是其7个月来首款非Flash级专有模型。在文本竞技场中,Argon以1533分排名第一,碾压Opus 5.5;在Artificial Analysis智能指数上获53分,追平GPT-6 Astra,领先GPT-6.1 Sol。成本方面,单任务成本仅1.99美元,为GPT-6 Astra的60%,处于帕累托前沿。模型单次输出上限提升至100万Token,并在谷歌内部用安全语言重写了80万行底层系统内核代码。Vals RSI指数上,Argon超过GPT-6 Astra达30%以上。目前该模型仅开放给Google Fairwind计划中的网络安全防御方,后续将开放给付费API用户和AI Ultra订阅者。

Gemini 4震撼发布,已实现RSI?谷歌80万行内核已被重写

定价方面,百万输入Token 2美元,百万输出Token 10美元,缓存输入折扣达95%。在Artificial Analysis统计的每项智能指数任务综合成本中,GPT-6.1 Sol为0.72美元,Argon为1.99美元,GPT-6 Astra为3.26美元,Claude Opus 5.5为5.98美元,Claude Fable 5.1为7.63美元。在智力水平与GPT-6 Astra持平的情况下,Argon成本仅为其60%。谷歌意图利用TPU算力集群优势打价格战,逼迫竞争对手降价。

Gemini 4震撼发布,已实现RSI?谷歌80万行内核已被重写

输出上限从64K提升至1M Token,使模型拥有更大思考余量,能在单次运行中生成数十万token,实现深度连续推理。基准测试表现:DeepSWE v1.1获77.9% SOTA,Vals Index位列第一(68.9%),AutomationBench以51.3%居首,LVBench获91.7%,Blueprint-Bench 2位列第一。

Gemini 4震撼发布,已实现RSI?谷歌80万行内核已被重写

内部实战中,Argon完成三件大事:其一,智能体团队自主分析性能遥测数据,释放超300 TiB内存,预计后续节省可达500 TiB至1 PiB;其二,主导将谷歌底层C/C++代码迁移至Rust,经手内核代码超80万行,包括Fuchsia Zircon内核;其三,在libgav1项目中用Rust重写3.2万行SIMD代码,运行速度比原Rust移植版快2.7倍,性能持平C++版本。

网络安全方面,Argon在CWE-bench v1上以68%得分并列第一。Wiz已在其项目中接入Argon,早期演示中成功挖出多家医院医疗软件中的重大漏洞。谷歌采取分层释放策略:无护栏特供版仅通过Fairwind计划向受信任防御机构开放;受限API版参与美国政府自愿发布前审查;公众版后续推送给付费开发者和AI Ultra订阅者。全面开放前,谷歌部署系统加固,高风险训练前物理级密封隔离沙箱,实时监控思维链,发现偏离即断网,且监控数据不反馈训练集。

发布背后,谷歌AI部门经历数月焦虑。5月I/O大会承诺的Gemini 3.5 Pro夭折,单次训练成本高达4亿美元。内部对Argon存在怀疑,有员工称其编程能力参差不齐,前端设计表现挣扎。AI专家Edwin Chen指出行业存在“刷榜综合症”。同时谷歌流失大量明星研究员,包括Jeff Dean淡出、John Jumper和Noam Shazeer离去。8月Demis Hassabis升任董事长,将DeepMind经营权交给Koray Kavukcuoglu。后者上周表示对团队致以最高信任,确信谷歌永远处于最前沿。谷歌急需Argon的成功,因为Gemini模型支撑着从搜索到Maps、Gmail等核心业务。

标签: AI 资讯 AI

更多推荐阅读

AI编程“计划模式”刚成标配,就有人宣布它已死

AI编程“计划模式”刚成标配,就有人宣布它已死

这两天,Hacker News 上一篇《Plan mode is dead》引发关注。作者 Ayman Nadeem 是 YC 孵化的 AI 编程公司 Nuanced 创始人兼 CEO。她曾坚信规划是 AI 编程最重要的环节,并围绕这一判断打造桌面编程应用,但几个月后改变了看法。文章触及 AI 编程工具中一条正在松动的产品假设:写代码前,人要先整理出完整计划再交给 Agent。 Nadeem 认...

2026-09-30
齐俊元再创业:Today AI上线,要做更懂你的个人AI助理

齐俊元再创业:Today AI上线,要做更懂你的个人AI助理

9 月 28 日,Manus 发布 2.0 版本,并推出独立的个人 Agent 应用 Cue。每个 Agent 拥有自己的邮箱、电话、钱包和电脑,可以替你接电话、发消息,并在设定预算内付款。 海外 Personal Agent 赛道已相当热闹。Meta 的 Muse 上线 10 天在美国获得 73 万次下载,登上 App Store 免费榜第一。GrokBot 借助 X 的分发能力入场,Town...

2026-09-30
Meta新AI应用Muse爆红,小扎口碑逆袭背后逻辑

Meta新AI应用Muse爆红,小扎口碑逆袭背后逻辑

Personal Agent正在成为下一个风口。 过去三周,Meta发布的个人AI助手Muse成为科技圈最大变量。该应用9月8日上线,仅10天就登顶美国App Store免费应用总榜,第12天全球安装量达280万。9月21日,Meta单日股价上涨11.43%,市值增加近2000亿美元,此后股价稳定在700美元以上。 Muse为每个用户配备独立云端虚拟机,用户通过手机即可浏览网页、操作应用、发邮...

2026-09-30
腾讯秘密开发Personal Agent产品Handy Bot

腾讯秘密开发Personal Agent产品Handy Bot

腾讯正在秘密开发Personal Agent产品“Handy Bot”,并计划推出独立App。目前已在微信端低调上线服务号,简介为“Your Personal AI Agent”。产品仍处内部测试阶段,信息以官方口径为准。 当前行业正热议Personal Agent叙事,Meta刚推向市场的Muse将消费级智能体热度推至新高。传统Chatbot属会话驱动,一问一答,会话结束任务终止;Person...

2026-09-30
视频超分不再“变样”!RH Upscale 13组横评综合第一

视频超分不再“变样”!RH Upscale 13组横评综合第一

视频超分长期面临两难:传统方法能拉高分辨率,却难以找回丢失的细节;生成式方法能补细节,却可能导致人物变样、构图偏移,在视频中还会出现闪烁和拖影。画面要更清楚,原内容又不能被改掉。 海马云旗下 RunningHub 发布自研生成式视频超分模型 RH Upscale,目标为“放大而不改内容”,在提升分辨率、恢复纹理的同时,尽量保持人物、构图、色调及运动过程的一致性。在 13 组横向评测中,RH Up...

2026-09-30
320B中国开源黑马杀出,模型自己抓Bug揪出幽灵空格

320B中国开源黑马杀出,模型自己抓Bug揪出幽灵空格

就在昨天凌晨,一个320B的开源大模型IQuest-Q1发布,权重和blog一并公开。九月赛道竞争激烈,GPT-6 Astra、Fable 5.1、Gemini 3.8 Flash及国产Qwen3.8、GLM-5.3等接连发布。IQuest-Q1由至知创新研究院(IQuest Research)推出,在写代码库、挖安全漏洞和长程复杂任务等硬核评测中与头部模型同台竞技。 研发团队一次强化学习训练中...

2026-09-30
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部