谷歌Meta被指刷榜 Gemini测试暴跌70分

谷歌Meta被指刷榜 Gemini测试暴跌70分

AI 资讯 来源:新闻/公众号 发布时间:2026-09-13 更新于 2026-09-13 预计阅读 4 分钟

9月8日,分析机构SemiAnalysis连发五条推文,点名谷歌和Meta,称Gemini 3.8 Flash和Muse Spark 1.3是“刷榜痕迹最明显的两个模型”。

谷歌Meta被锤刷榜!Gemini暴跌70分,Top 2秒变倒数第三

证据来自榜单成绩的剧烈反差。在测Agent干活能力的Terminal-Bench 2.1上,Gemini 3.8 Flash考了89.4分,在182个模型中排第2,超过GPT-6 Astra;Muse Spark 1.3以88.8分排第4。但换到8月29日上线的Terminal-Bench 4.0,Gemini 3.8 Flash只拿到19.1分,在14个测试对象中掉到第12;Muse Spark 1.3为33.3分。同期GPT-6 Astra从88.4降到57.7。

谷歌Meta被锤刷榜!Gemini暴跌70分,Top 2秒变倒数第三

Meta首席AI官Alexandr Wang随后在评论区反驳,称这是“愚蠢的论点”,并指出GPT-5.6 Sol在2.1上是88.8,在4.0上掉到37.3,落差更大却没人说它刷榜。他还强调Meta从未说过Muse Spark 1.3能跟Astra或Fable 5.1一样强,只是性价比更高。

谷歌Meta被锤刷榜!Gemini暴跌70分,Top 2秒变倒数第三

Terminal-Bench测的是Agent真实干活能力:给模型一个终端和模糊目标,让它自行规划、调工具、写脚本并改错。4.0版本共66道题,砍掉8道已被“刷穿”的旧题,大修19道,加入8小时超时限制,并设置35条评分细则和“对抗性作弊试验”,故意让Agent尝试钻奖励机制空子,钻得通就毙掉。新榜中,Claude Mythos 5.1(max)以60.9分居首,GPT-6 Astra和Claude Fable 5.1分别为57.7和55.8分,Claude Opus 5为52.3分,上一代GPT-5.6 Sol和Terra分别为37.3和23.6分。

SemiAnalysis指出,真正内幕在于:2.1任务完全公开,Meta和谷歌不会直接拿原题训练,但会购买无限贴近TB 2.1题型的训练数据,效果等同作弊。这已成明码标价的生意:单个训练任务售价200到2000美元,复杂软件工程任务可达2万美元,克隆网站约2万美元,复刻Slack量级产品30万美元起步,独家买断再翻4到5倍。Epoch AI调研称,Anthropic内部讨论过每年砸10亿美元;单季合同动辄六七位数,有研究员透露均价30万到50万美元一季。供给侧至少35家公司,多数为20人以下初创团队,Scale AI被Meta入股前营收超14亿,Surge的ARR逼近10亿。

SemiAnalysis还点名Datacurve。在长周期编程榜单DeepSWE 1.1上,Muse Spark 1.3(max)以75.4分第一,GPT-6 Astra和Claude Opus 5紧随其后,Gemini 3.8 Flash以73.8分第四。该榜由Datacurve主办,而Datacurve同时向前沿实验室出售“专家级编码数据和强化学习环境”,既当卖题机构又当监考老师。

SemiAnalysis最后判断,所有优质公开基准都难逃此宿命,TB 4.0现在准只是因为才发布两周。解药是多做高质量私有基准,但代价是公开榜单将沦为营销通稿,真实成绩只在实验室和私有评测机构间流动。大厂乐见其成,但开发者将失去公平丈量所有模型的公共尺子。

标签: AI 资讯 AI

更多推荐阅读

Kimi全球招人:辍学、创业失败者优先

Kimi全球招人:辍学、创业失败者优先

本周三,Kimi首次面向全球开启公开招聘。此前K3火爆出圈,Kimi此时开闸招人,不仅招算法,也大规模招募产品、运营、设计、销售、市场及国际化等业务岗位,业务团队首次面向2027届、2028届毕业生和在校实习生开放校招。同时,Kimi计划在全球招募7名“Wild Card”,定位为下一代接班人/未来业务合伙人。 更值得关注的是其用人信号。招募材料明确列出几类不会成为减分项的经历:休学或辍学、连续...

2026-09-13
Kimi K2.8上线:性能逼近K3,百万上下文全员开放

Kimi K2.8上线:性能逼近K3,百万上下文全员开放

9月11日,Kimi K2.8 Preview在Kimi Code和Kimi Work全量上线,官方称综合性能接近旗舰K3,Coding和Agent能力进一步提升。最实质的变化是权限:所有会员档位都能用上1M上下文,而K3的百万上下文仍需Allegretto及以上会员。 就在前一天,外界获悉月之暗面ARR在8月突破10亿美元,6月这一数字还是3亿。这轮增长的直接催化剂是7月发布的K3,曾凭借SO...

2026-09-13
模型越强Harness越轻还是越重?OpenAI与Anthropic工程师给出相反答案

模型越强Harness越轻还是越重?OpenAI与Anthropic工程师给出相反答案

模型越来越强后,Harness 会变重还是变轻?OpenAI 和 Anthropic 工程师给出不同判断。OpenAI Codex 团队 Tibo 认为,随着模型进步,开发者消息会越来越短,Harness 会越来越轻。Anthropic Claude Code 团队 Thariq Shihipar 则认为,模型越强,Harness 反而越复杂,因为要让模型做更多事。 Tibo 表示,Codex ...

2026-09-13
OpenClaw之父复盘生死8个月:被断供、围剿与18000人提交

OpenClaw之父复盘生死8个月:被断供、围剿与18000人提交

图片来源:Peter Steinberger 我常反省:是不是我设计的循环有问题?是不是没给Agents提供验证工作所需的一切?是不是思路有误?是不是在要求不可能的事? 我们不应再考虑“会话”或“上下文压缩”。我们正进入一个新世界,终于要从纯文本界面转向语音和多模态。昨天我们跑通一个hack,现在你的Claw可以给你打FaceTime。这才是OpenClaw存在的意义。 八个月里,超过18,...

2026-09-13
Meta新AI应用Muse美区下载量破8万,登App Store第二

Meta新AI应用Muse美区下载量破8万,登App Store第二

Meta的新AI应用Muse于周二上线后,正开始赢得华尔街青睐。这家科技巨头进军Agentic AI领域,也成为业内人士在X平台上热议的话题。早期数据为了解Muse在美国消费者中的实际受欢迎程度提供了参考。 市场情报公司Sensor Tower数据显示,Muse在美国iOS平台下载量已超过83,000次。该应用目前仅限美国地区使用。尽管这一成绩使Muse登上App Store热门榜单第二位,但与...

2026-09-13
北大系公司押注端侧AI:27B模型装进电脑,断网也能干活

北大系公司押注端侧AI:27B模型装进电脑,断网也能干活

一个27B参数的模型原生存在于电脑里,关掉Wi-Fi照样能读取本地文件、翻数据库、处理Excel、写PPT,连续跑过去通常需要调用云端大模型的复杂任务。公司财务数据不用上传,自己的知识经验留在本地,跑得再多也不用盯着随Agent工作时间不断上涨的Token账单。电脑买了,电费交了,剩下的Token随便用。 过去端侧AI唯一麻烦的是模型不太行。1B、3B模型装进手机已不稀奇,但让它读几千条银行流水...

2026-09-13
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部