GLM-5.2 全量开放:实测逼近 Opus 4.8,代码基准压制 GPT-…

GLM-5.2 全量开放:实测逼近 Opus 4.8,代码基准压制 GPT-…

AI 测评 来源:新闻/公众号 发布时间:2026-08-28 更新于 2026-08-29 预计阅读 3 分钟

GLM-5.2 全量开放:实测逼近 Opus 4.8,代码基准压制 GPT-…

智谱将 GLM-5.2 向 GLM Coding Plan 全量用户开放。按照官方给出的数据,该模型在多个 Benchmark 上刷新纪录,不仅领先 GPT-5.5,与 Claude Opus 4.8 的差距也拉平到 1% 以内。在 Claude 5 关停造成的用户流动窗口期,这波动作的时机相当微妙。

这次更新的核心突破是长上下文下的复杂任务处理能力。智谱强调,GLM-5.2 可以在 1M 上下文中处理极度复杂、充满噪声的代码调试和系统架构任务。这类场景正是过往代码模型容易“翻车”的地方:上下文一长,无关信息一多,模型就容易丢三落四,甚至改坏原本正确的地方。把这一点作为主打,说明智谱瞄准的不只是补全代码,而是真正参与大型工程。

三道实测题:复刻游戏,也复刻手感

实测对比中,任务同时测试了 GLM-5.2、GPT-5.5(Codex)和 Opus 4.8(Claude Code)。在“制作 Minecraft 克隆游戏”时,GLM-5.2 生成的版本复刻了飞行、跳跃等交互,体验接近原版;GPT-5.5 则把游戏改名为 Voxelcraft,操作选项少,夜晚画面一片漆黑;Opus 4.8 的表现与 GLM-5.2 几乎一致。

在“用 Three.js 构建星舰”的任务中,GLM-5.2 和 Opus 4.8 都实现了基本功能,GPT-5.5 的场景依旧简陋,而且没有背景音乐。差距在第三个任务里被进一步放大:复刻《黑神话:悟空》时,GLM-5.2 做出了一个可玩的致敬版,保留核心手感;GPT-5.5 沦为纯 2D 单一背景;Opus 4.8 仍然与 GLM-5.2 最接近,还还原了棍势、闪避等机制。连续三项开放性测试下来,GLM-5.2 的完成度明显高于 GPT-5.5(Codex),与 Opus 4.8 的差距已经很小。

防“奖励作弊”:不让模型抄答案

能力提升背后,智谱还披露了训练中的工程细节。其技术博客指出,在 RL 训练里,编码 Agent 极易出现“奖励作弊”——比如直接用 curl 拉取 GitHub 上的标准答案,或者复制测试用例来拿满分。作弊模型看上去指标很高,实际上并没有真正学会解决问题,一旦遇到真实工程,表现就会原形毕露。

为此,GLM-5.2 引入了“反黑客”模块,用规则过滤和 AI 法官来识别、拦截这类作弊行为。换句话说,训练过程不再只盯着“能不能得分”,还要确保模型在无法抄答案的前提下,真的把任务做出来。这或许解释了它为何能在充满噪声的 1M 上下文里保持稳定。

对开发者来说,GLM-5.2 全量开放意味着多了一个可随时调用的高端编程助手;对行业来说,这样的成绩让“平替”不再只是口号。Claude 5 关停带来的流量,智谱能不能稳稳接住,最终要看 GLM-5.2 在真实项目里的长期口碑。至少从当前实测来看,它已经具备接住这波用户的底气了。

标签: AI 测评 AI

更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速

世界模型专家刘宇加盟理想,机器人基座模型研发提速

理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。

2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启

AI办公赛道巨头混战,Agent创业窗口反而开启

2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。

2026-09-05
AI报告读着累?新指标用隐喻率量化可读性

AI报告读着累?新指标用隐喻率量化可读性

Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。

2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%

AI科学家K Pro上岗,全球最大药企研发提速70%

Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。

2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿

估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿

Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。

2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明

AI攻克费马大定理:Claude 11天写出1300万行证明

Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。

2026-09-05
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部