320B中国开源黑马杀出,模型自己抓Bug揪出幽灵空格
就在昨天凌晨,一个320B的开源大模型IQuest-Q1发布,权重和blog一并公开。九月赛道竞争激烈,GPT-6 Astra、Fable 5.1、Gemini 3.8 Flash及国产Qwen3.8、GLM-5.3等接连发布。IQuest-Q1由至知创新研究院(IQuest Research)推出,在写代码库、挖安全漏洞和长程复杂任务等硬核评测中与头部模型同台竞技。

研发团队一次强化学习训练中,模型得分曲线突然走平,系统无报错。IQuest-Q1自行排查训练日志、对话记录和代码,发现元凶是一个多余空格:推理服务将输出转回文字时多塞了一个空格,训练系统逐字比对后把连贯对话切成几截,导致模型只能从最后一轮学习。关掉该设置后,平均得分从0.704升至0.769,后段进一步达0.799。这套原本需工程师熬夜数通宵的工作,由模型自主完成。

IQuest-Q1采用稀疏MoE架构,训练使用多教师在线策略蒸馏(MOPD),请来四位各有所长的“老师”模型,在学生自己答题基础上批改,再合并多阶段、多路径模型。在NL2Repo、CyberGym、Terminal-Bench 2.1、DeepSWE v1.1及JobBench等评测中表现优异。

实测中,它管理小城早高峰6个路口:先测出车流路口间约18秒,设计绿波让下个路口绿灯晚18秒亮,再将下排路口整体推后18秒,救护车进入某排时全排切绿灯。54分钟边跑分边改,复测零事故,每车平均多等时间从6分钟压到22秒,救护车穿城从近4分钟降至1分钟出头。
电商仓库任务中,8台机器人应对平日220单、双11 420单及临时封路。朴素调度几分钟就堵死。IQuest-Q1先搭可运行调度,打印车辆位置,发现两格宽通道迎面相遇需绕行,又发现空车停在打包台堵路,让空车主动离开并调整入口。复测零撞车,平日和封路局全部送达,双11送出87%,朴素调度仅几十单。
24层写字楼4部电梯调度中,规则为按钮到进梯超60秒或梯内超180秒算不准点。朴素方案高峰大堂排长队。IQuest-Q1分析发现早高峰每趟塞满13人,运力不足,于是让空梯在大堂等人满再走;晚高峰先到最高下行楼层再一路接人,并为低楼层预留位置。复测晚高峰准点率从26%提到61%,平峰从70%升到88%。
前端能力方面,每道设计题只许用一个HTML文件,画面、贴图、音效全靠代码生成。作品多数两三千行代码。“二十四节气水乡”中,白墙黛瓦马头墙沿河排开,节气变换时天色、草木、天气随之变化。
更多推荐阅读

AI编程“计划模式”刚成标配,就有人宣布它已死
这两天,Hacker News 上一篇《Plan mode is dead》引发关注。作者 Ayman Nadeem 是 YC 孵化的 AI 编程公司 Nuanced 创始人兼 CEO。她曾坚信规划是 AI 编程最重要的环节,并围绕这一判断打造桌面编程应用,但几个月后改变了看法。文章触及 AI 编程工具中一条正在松动的产品假设:写代码前,人要先整理出完整计划再交给 Agent。 Nadeem 认...
2026-09-30
齐俊元再创业:Today AI上线,要做更懂你的个人AI助理
9 月 28 日,Manus 发布 2.0 版本,并推出独立的个人 Agent 应用 Cue。每个 Agent 拥有自己的邮箱、电话、钱包和电脑,可以替你接电话、发消息,并在设定预算内付款。 海外 Personal Agent 赛道已相当热闹。Meta 的 Muse 上线 10 天在美国获得 73 万次下载,登上 App Store 免费榜第一。GrokBot 借助 X 的分发能力入场,Town...
2026-09-30
Meta新AI应用Muse爆红,小扎口碑逆袭背后逻辑
Personal Agent正在成为下一个风口。 过去三周,Meta发布的个人AI助手Muse成为科技圈最大变量。该应用9月8日上线,仅10天就登顶美国App Store免费应用总榜,第12天全球安装量达280万。9月21日,Meta单日股价上涨11.43%,市值增加近2000亿美元,此后股价稳定在700美元以上。 Muse为每个用户配备独立云端虚拟机,用户通过手机即可浏览网页、操作应用、发邮...
2026-09-30
腾讯秘密开发Personal Agent产品Handy Bot
腾讯正在秘密开发Personal Agent产品“Handy Bot”,并计划推出独立App。目前已在微信端低调上线服务号,简介为“Your Personal AI Agent”。产品仍处内部测试阶段,信息以官方口径为准。 当前行业正热议Personal Agent叙事,Meta刚推向市场的Muse将消费级智能体热度推至新高。传统Chatbot属会话驱动,一问一答,会话结束任务终止;Person...
2026-09-30
视频超分不再“变样”!RH Upscale 13组横评综合第一
视频超分长期面临两难:传统方法能拉高分辨率,却难以找回丢失的细节;生成式方法能补细节,却可能导致人物变样、构图偏移,在视频中还会出现闪烁和拖影。画面要更清楚,原内容又不能被改掉。 海马云旗下 RunningHub 发布自研生成式视频超分模型 RH Upscale,目标为“放大而不改内容”,在提升分辨率、恢复纹理的同时,尽量保持人物、构图、色调及运动过程的一致性。在 13 组横向评测中,RH Up...
2026-09-30
GPT-6也会看错流程图?视觉编程评测新基准发布
Coding Agent 正从纯文本世界走向视觉世界。越来越多任务要求 Agent 将流程图、设计稿、3D 草图乃至 PPT 等视觉目标转化为可执行、可编辑的代码,这一能力被称为 Visual Coding。其难点在于:Agent 不仅要保证代码可运行,还需从视觉输入中理解对象、结构、空间关系和语义,并准确编码进程序。 PPT 成为理想测试载体:它由文本、形状、连接线、分组和布局构成,既是可编辑...
2026-09-30