白菜价挑战旗舰:谷歌Gemini 3.8 Flash如何搅动AI市场
谷歌近日推出Gemini 3.8 Flash及网络安全专用版Gemini 3.8 Flash Cyber,这是六周内第三个Flash版本。该模型以极低的成本挑战旗舰级AI,单任务成本仅0.58美元,输入价格0.75美元/百万Tokens,输出价格3.75美元/百万Tokens,生成速度高达305 tokens/s。在Artificial Analysis高推理模式下,其智力指数达59分,接近GPT-5.6 Sol和Grok 4.6,部分维度甚至超越Claude Opus 5。

性能与成本的双重突破

在DeepSWE v1.1基准测试中,Gemini 3.8 Flash得分73.7%,超越多数昂贵的前沿模型。谷歌内部代码工具Jetski测试显示,工程师更倾向于使用3.8 Flash而非Opus。这一表现得益于谷歌的“代码突击队”——由CTO领导、谢尔盖·布林监督,并挖来前OpenAI后训练负责人Barret Zoph担任研究副总裁,强化编程能力。

然而,Meta的Muse Spark 1.3在智能指数上获62分,与Claude Fable 5持平,输入成本比Fable 5低8倍。Meta首席AI官Alexandr Wang公开质疑Gemini的表现,认为其高分可能含有“水分”。有分析指出,3.8 Flash在TBench 2.1与TBench 4间分数差距大,可能存在“刷榜”成分,面对陌生的Zero-shot挑战时或不如Opus 5。

谷歌回应称,性能提升源于设计选择:模型面对复杂任务时会执行额外推理步骤、迭代调用工具,通过消耗更多Token进行自我验证。由于基础单价低,即便额外消耗,总成本仍低于直接调用GPT-5.6。这种“以量取胜”的策略,打破了传统“大参数=强能力”的竞争维度。

未发Pro的隐情与安全版亮点
谷歌迟迟未发Pro版本,原因在于内部3.5 Pro候选模型未比Flash强出足够身位而被毙,下一代Gemini 4仍卡在后训练阶段。这或许解释了为何谷歌急于推出Flash系列来抢占市场。
网络安全专用版Gemini 3.8 Flash Cyber在CyberGym基准测试中得分86.2%屠榜,跨20种编程语言漏洞发现成功率超70%。Chrome安全团队测试显示,其生成正确修复补丁数量是此前最好商业模型的2.6倍;Wiz测试中渗透测试召回率提高7.5-9.7%,成本降低2.3-5.2倍。谷歌云漏洞研究团队利用其在2小时内发现关键漏洞,而人类专家通常需数月。
因安全风险,该模型未完全开源,仅通过Fairwind计划向受信任机构开放。这一谨慎态度反映了AI安全与开放的平衡难题。
三巨头路线分化
当前AI三巨头路线分化明显:Anthropic侧重知识可靠性与事实准确率,在AA-Omniscience测试中前七名均为Claude系;OpenAI押注深度推理;谷歌则以性价比和速度切入,通过强化学习与Agent循环实现突破。Gemini 3.8 Flash的发布,不仅是对旗舰模型的“降维打击”,更可能重塑AI应用的商业模式——当推理成本降至如此低位,AI代理、实时交互等场景将迎来爆发。这场由谷歌掀起的“价格战”,或许将迫使整个行业重新思考:在AI竞赛中,参数规模是否还是唯一的胜负手?
更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速
理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。
2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启
2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。
2026-09-05
AI报告读着累?新指标用隐喻率量化可读性
Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。
2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%
Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。
2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿
Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。
2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明
Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。
2026-09-05