谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步
谷歌发布Gemini 3.8 Flash,Coding能力大幅提升,在LMArena Agent榜单位列第14,以微弱优势险胜DeepSeek-
V4-Pro。该模型定价与3.7 Flash保持一致,性能显著增强,多数场景逼近旗舰模型。在DeepSWE v1.1中可端到端解决复杂工程问题,

得分超过多数更大模型,成本极低。金融、法律等企业级Agent场景表现优于3.7 Flash及其他前沿模型。HLE-Verified得分54.9%
,多步推理能力与旗舰差距缩小。

然而,其智能水平未见本质提升,高得分主要依靠增加推理步骤和反复调用工具,高effort档位下可能消耗更多Tok
en。谷歌方法论与OpenAI、Anthropic不同,后者追求用更少步骤完成任务,而谷歌依赖循环迭代弥补模型智能不足。3.8 Flash是当前

输出速度最快的模型,远超第二名Meta。但有网友指出,其在Terminal-bench 4.0等新基准上表现不佳,疑似刷分。
过去一个半月,谷

歌经历人事变动,包括Jeff Dean离职,却连续推出三款Flash模型。DeepMind成员姚顺宇暗示,这可能是迈向RSI(递归自我改进)的一
步。

同时,谷歌发布Gemini 3.8 Flash Cyber,号称史上最强网络安全模型,专攻漏洞发现与补丁生成。在CyberGym测试中超
过3.5 Flash Cyber,内部代码库挖洞成功率超70%。CWE-Bench上pass@1达47.2%,与领先的47.8%几乎持平,成本更
低。该模型已在谷歌内部应用:Chrome安全团队使用其产出正确补丁数量为最强商业模型的2.6倍;Wiz渗透测试召回率提升7.5至9.7个百分点,
成本仅为其他模型的2.3至5.2分之一;Google Cloud漏洞研究团队用其不到两小时挖出关键漏洞。但该模型不公开发布,仅通过Fairwin
d计划向受信防御者开放。
同日,Meta发布Muse Spark 1.3,对标Opus 5,Agent和Coding能力大幅提升,并公开嘲讽G
emini。
更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速
理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。
2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启
2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。
2026-09-05
AI报告读着累?新指标用隐喻率量化可读性
Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。
2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%
Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。
2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿
Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。
2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明
Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。
2026-09-05