编程榜第二仅次Claude,Qwen3.7 Max能否撼动GPT-5.5?

编程竞技榜刚刚刷新了排名。阿里最新旗舰模型Qwen3.7 Max位列第二,超越了GPT-5.5、Gemini 3.5 Flash和DeepSeek V4 Pro,仅排在Claude Opus 4.7之后。对国产模型而言,这个位置不只是“又刷新一次榜单”那么简单——在真实用户投票的竞技场里,它已经跨过了多个国际旗舰门线。
大模型竞争走到第四年,各种排行榜的迭代速度已经让人有些麻木。但Qwen3.7 Max这次登榜仍有独特的看点:编程竞技榜的排名不是来自固定题库,而是来自大量真实编码场景中的用户选择。开发者将他们手头的编程任务提交到匿名对比池,模型分别给出答案,再由用户投票决定谁更优。Qwen3.7 Max能在这样的规则下压过DeepSeek V4 Pro和Gemini 3.5 Flash,只落后于Claude Opus 4.7,说明它在实际使用中的说服力并不输给那些大名鼎鼎的对手。
三重评测里的国产第一
除了竞技榜上的用户选择,Qwen3.7 Max在传统大模型固定评测中也交出了出色答卷。终端能力Terminal Bench、编程能力SWE Bench等榜单上,它都拿下了国产模型的冠军。Terminal Bench考察的是模型在终端环境中执行命令、处理系统任务的熟练度;SWE Bench则要求模型直面真实的GitHub Issue,完成代码修复与改进。一个考验“动手操作”,一个考验“改码功夫”,正好对应当前AI编程助手最常用的两类工作。Qwen3.7 Max能在这两项上均领跑国产阵营,说明它的编程能力并不偏科,也并非靠着刷题模板换来的虚名。
给Codex换一颗Qwen的“大脑”
榜单反映的是历史成绩,真正让人手痒的是实际体验。目前最火的Coding Agent组合,大概就是搭配了GPT-5.5的Codex。一个自然而然的问题冒了出来:如果把Codex的默认模型从GPT-5.5换成Qwen3.7 Max,再让它去处理日常的编码任务,结果会不会反而更好?这正是作者想做的实验。虽然榜单刷新已经见怪不怪,但一个能超越GPT-5.5的国产模型,确实值得“拉出来遛一遛”。
获取Qwen3.7 Max的路径并不复杂。现在各家都在推出Token优惠活动,阿里云也提供了100万Token的优惠额度,足够支撑起一轮替换模型的实测。把Codex的模型配置改成Qwen3.7 Max,然后让它写脚本、修Bug、查日志,看看它在真实工作流中的表现,这个测试显然比单纯看榜单排名更有参考价值。
编程竞技榜的座次还会随着用户的投票不断变化,但Qwen3.7 Max现在的位置已经释放出一个明确信号:国产模型在编程这条最重要的AI赛道上,已经拿到全球第一梯队的入场券。至于它能否撼动GPT-5.5在Codex里的默认地位,还需要真实的任务来给出答案。至少这一次,挑战者已经做好了准备。
更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速
理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。
2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启
2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。
2026-09-05
AI报告读着累?新指标用隐喻率量化可读性
Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。
2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%
Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。
2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿
Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。
2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明
Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。
2026-09-05