网吧里的AI大考:30个野路子Bench揭示模型真实力

网吧里的AI大考:30个野路子Bench揭示模型真实力

AI 资讯 来源:新闻/公众号 发布时间:2026-09-01 更新于 2026-09-01 预计阅读 4 分钟

在网吧的喧嚣中,一场别开生面的AI评测悄然展开。懂模帝Bench黑客松汇聚了一群脑洞大开的选手,他们边畅饮边打造出30个独特的Bench,旨在拷问大模型的真实能力。这场活动不仅产出了一份另类的模型评测报告,更暴露出主流Bench过度聚焦编程和长程任务、忽视非编程领域的盲区。现场无人问津传统编程题,创意反而集中在模拟经营(如北漂模拟器、偶像出道模拟器)、真实环境测试(如网吧渗透导致电脑全黑)和垂直领域(如医疗器械立项决策)等方向,凸显了让普通人定义模型能力的独特价值。

嵌入式底层驱动:细节见真章

仙五基于真实工作设计的嵌入式底层驱动开发Bench,要求模型编写驱动、处理寄存器与中断。结果显示,Qwen3.8-Max功能完成度最高,测试和逆向深度均拔得头筹;DeepSeek虽简单题全过,却在复杂DMA场景中遭遇“写了但未接通”的尴尬;Opus 5.0代码质量最佳,但隐藏压力场景S5表现不佳,40轮中出现5次初始化失败和15次操作失败;GPT虽跑通任务却选择静默修复,质量分仅11;SD3则因参数和错误契约不精确而败北。作者坦言,实际手册上千页,题目仅为玩具级,但已足以窥见模型在真实工程中的差距。

物理世界:无全知全能者

具身选手张振尧提供的物理理解Bench覆盖无人机巡逻、机械臂抓取、切割、布料覆盖等场景。无人机巡航中,仅Qwen完成全部航点(RMS误差0.16米),其余模型“全军覆没”;材质抓取K3表现最佳(3/3无失误);吸盘搬运GPT完胜(误差2.7-2.9厘米),DeepSeek后两轮恢复至0.5厘米;切割题Qwen、GPT、DeepSeek稳定满分;布料题则无模型稳定攻克,DeepSeek首轮75%覆盖为最高。总分Qwen居首,K3物理直觉强但交付纪律弱,Claude恢复能力突出但首轮可靠性差。结论清晰:物理场景无全知全能模型。

破壁者:德州扑克中的策略博弈

灵感源自《三体》的破壁者Bench,用德州扑克测试模型在有限条件下的最优解能力,分文本和视频两种输入。K3判断最佳,善用行为线索且不盲目跟注;Claude牌理清晰,但抽帧信息导致误判;Qwen打法保守,加入视频后胜率反降;GPT同样保守,而DeepSeek过于激进常跟错牌。这场博弈揭示了模型在策略推理上的参差。

总结:编程专精,AGI尚远

这场网吧黑客松的结论颇具启示:大模型在编程上已远超人类,但非编程场景水平参差。Qwen3.8-Max工程能力更强,在物理、嵌入式等小众场景表现突出;K3综合智力较强,尤其擅长多模态经营模拟类。然而,各模型均为“编程专精”,距离AGI、ASI仍路途遥远。这场评测不仅是一次技术较量,更提醒我们:AI的能力边界,远未触及普通人眼中的“智能”。

标签: AI 资讯 AI

更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速

世界模型专家刘宇加盟理想,机器人基座模型研发提速

理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。

2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启

AI办公赛道巨头混战,Agent创业窗口反而开启

2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。

2026-09-05
AI报告读着累?新指标用隐喻率量化可读性

AI报告读着累?新指标用隐喻率量化可读性

Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。

2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%

AI科学家K Pro上岗,全球最大药企研发提速70%

Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。

2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿

估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿

Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。

2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明

AI攻克费马大定理:Claude 11天写出1300万行证明

Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。

2026-09-05
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部