奥赛题4分钟解出、定位误差10公里内:Qwen3.7实测亮眼

阿里Qwen3.7系列预览版已正式上线,分为Max和Plus两个版本。在大模型竞技场中,Qwen3.7-Max-Preview总榜排名第13,位列GPT-5.5与Grok-4.2之间,成为榜单上排名最高的国产模型。与此同时,实际测试显示,这款模型不仅能在几分钟内解出国际奥赛难题,还能识别地点、复刻应用界面,图文视觉能力均表现出色。
国产模型的新高度
大模型竞技场的最新排名为Qwen3.7提供了直观坐标。Qwen3.7-Max-Preview总榜第13,数学细分榜单第7,专家任务第9,软件与信息技术第9,编程第10。另一款Qwen3.7-Plus-Preview则在视觉榜排名第16,得分介于GPT-5.4和Gemini-3 Flash之间。虽然官方尚未披露技术细节,但两款模型已在Qwen Studio开放,采取闭源模式,其中Max目前仅支持推理模式。按计划,预计将在阿里云峰会上正式发布。
实测:解奥赛题、写代码、辨图识地
实际体验中,Qwen3.7-Max-Preview展现了对高难度任务的驾驭能力。面对2025年国际数学奥林匹克难题,模型用时约4分钟便得出正确答案。编程方面,它能够生成番茄钟桌面应用,并修复了Tkinter打包后出现的透明色错误,最终让应用正常运行。它还能直接用HTML输出产品需求文档,结构完整,不过产品定义显得有些大而全。此外,模型可以绘制动态SVG图片,并能正确解答“海龟汤”这一文字谜题。
Qwen3.7-Plus-Preview在视觉能力上同样不遑多让。在进阶版“洗车店难题”测试中,它成功给出解决方案;通过分析建筑风格和山脉形态,模型判断出的地点与正确位置相距不到10公里。更令人印象深刻的是,它能够依据UI风格识别出微信,并复刻出一个网页版聊天界面,外观还原度很高,但按钮不可用。
这些结果说明,Qwen3.7在数学推理、代码生成、多模态理解等维度上都达到了相当高的水平,国产模型与全球第一梯队的差距正在进一步缩小。
高频迭代背后的策略
值得关注的是,Qwen系列的更新节奏明显加快。2026年2月至今,阿里已先后发布Qwen3.5、3.6、3.7三代模型,而2025年全年仅有两个主要版本。从这一变化可以看出,Qwen正转向高频预览版和能力增量更新的模式,让模型更快进入真实场景接受检验。对开发者和企业用户而言,这意味着更及时的体验反馈和更敏捷的版本迭代;对行业而言,国产大模型的竞争节奏也随之提速。
从榜单成绩到实际表现,Qwen3.7系列交出了一份亮眼的答卷。随着阿里云峰会的临近,这款模型的完整技术细节和后续规划值得期待。在国产大模型奋起直追的浪潮中,Qwen3.7无疑又向前迈进了一大步。
更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速
理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。
2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启
2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。
2026-09-05
AI报告读着累?新指标用隐喻率量化可读性
Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。
2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%
Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。
2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿
Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。
2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明
Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。
2026-09-05