全模态模型Qwen3.8-Omni-Flash发布,主打音视频Agent能力
今天,新一代原生全模态模型Qwen3.8-Omni-Flash正式上线。该模型旨在提升真实生产力场景中的Agent能力,推动全模态模型从“理解全模态内容”走向“规划任务、调用工具并完成创作”。在具备编程、文本知识工作和GUI操作等通用Agentic能力基础上,进一步拓展了以音视频为核心的Agentic应用,在视频剪辑、音乐视频创作、影视制作与解说、音视频转图文摘要和音视频对话等工作流中取得显著效果。

模型支持文本、图像、音频和视频输入,以及1M长上下文,现已上线千问AI平台。在保持与同尺寸文本模型相当文本能力的同时,全模态能力显著提升。在累计30项评测上,相比上一代Qwen3.5-Omni-Plus,平均得分提升超过26%。在音视频Agent、Coding和长程任务方面,WildClawBench-MM提升36.5分,AgenticVBench提升22.3分,UniClawBench取得69.6分。基础能力方面,LongAudioSpan提升8.3分,OmniVideoBench提升9.6分,OmniCap-IF的CSR/ISR分别提升8.5/14.1分,AliMeeting的DER/cpWER从88.11/89.61降至3.35/17.18。通过扩展数据、上下文与Agentic Environment,音视频能力接近Gemini 3.8 Flash,音频能力整体超过Gemini 3.8 Flash。API每小时音频输入价格降幅超过98%,每小时音视频输入价格降幅超过93%。

音视频是Agent走向真实生产力场景的重要载体,但也带来长音视频存储、传输与多轮推理成本高昂、现有Agent Harness框架缺乏原生支持等挑战。为此,我们扩展了Qwen-MM-Plugins,为长音视频按需感知、工具调用与工作流执行提供支持;同时开源Qwen-Live Harness,为实时、持续的全模态交互提供原生运行环境。

长音视频理解方面,模型实现全新升级:从按需描述、Agentic主动取证,到理解并推进会议任务,再到生成以视频为中心的深度研究报告。可控音视频Caption支持自由指定描述对象、时间范围、信息粒度与输出格式。Agentic长音视频理解从问题出发,自主决定看什么、听什么,通过由粗到细的多轮取证定位关键信息。OmniVideoBench实验表明,Agentic Understanding将准确率从63.4提升至67.8,Token消耗从145,736降至79,117,降幅约45.7%。
长会议场景中,模型具备多说话人音画协同识别能力,原生支持最长一小时音视频输入,端到端完成说话人切分、内容转录与身份对应,可生成会议纪要与待办事项,分析项目风险,并结合Agent与工具调用发送邮件、整理任务甚至直接编码。通过音视频开展深度研究时,模型能结合用户需求与视频内容,检索多模态资料,生成以视频为中心、图文并茂的研究报告。
音视频生产与编辑方面,Music2MV可精准理解歌曲结构、节奏、情绪等,输出带时间戳的句级歌词,结合Qwen-MM-Plugins贯穿音乐理解、创意规划与成片质检。视频翻译Agent只需一句话描述需求,即可完成区分角色的台词识别、口语化翻译、角色克隆配音、音轨重混与成片质检。电影解说Agent只需提供影片并描述需求,即可完成长视频全模态理解、关键情节提炼、解说规划、配音配乐、剪辑渲染与成片质检,并智能穿插原声对白与解说配音。
此外,我们尝试将Qwen3.8-Omni-Flash推进到模型研发本身,探索“大模型负责研发、小模型面向业务”的新范式。例如,要求其在12小时内提升Qwen2.5-Omni-3B的四川话识别能力并交付可用模型,它自主选定评测集、完成基线测试,听取语音样本诊断问题,构建针对性训练数据,在连续4轮实验中累计构建了3,413条……
更多推荐阅读

机器人量产了,具身智能为何反而更难了?
机器人本体批量落地,行业要补的课反而更多了。本体数量上来了,具身智能看似离规模化越来越近,但理解世界、学习新任务、持续进化的能力,还无法随机器人一起批量复制。行业关注重点正从如何造出机器人,转向如何持续生产和迭代机器人的能力。 9月16日,在2026智能经济论坛上,百度集团执行副总裁沈抖判断:智能体能力边界快速打开,已能处理更长程任务并进入规模化部署。类比AI时代,今天可能只是灯泡发明后的第一个...
2026-09-18
50万份文档喂给AI,WPS如何闯入造船厂一线?
企业AI下半场,拼的是数据和上下文。 一家船厂手里压着近50万份研发制造文档;一名船舶设计师从新手成长为专家,往往需要十年以上。2026年下半年,腾讯WorkBuddy、阿里千问办公、字节豆包工作几乎同时把企业级Agent推到台前,加上金山办公,国内AI办公“四强”格局基本成形。但企业级Agent的卡点不是模型不够聪明,而是能否读懂海量图纸、规范和老师傅脑中未写下的判断标准。 金山办公带着WP...
2026-09-18
Claude狂写80%代码,Anthropic的CI半年被撑爆25倍
Anthropic披露内部数据:全公司80%的代码由Claude编写,工程师人均每季度交付代码量达2021—2025年平均水平的8倍。Claude还承担大量PR审查与合并批准工作。写代码、审代码不再是瓶颈,但CI系统在半年内被压垮:测试用例激增10倍,CI任务量暴涨25倍。 根本原因在于AI与人类研发行为模式的差异。人类提交PR数量有限、倾向打包改动,且需要休息,CI有低谷期消化任务。而Clau...
2026-09-18
字节AI教育出海记:豆包爱学如何让孩子少走弯路
过去两年,AI落地场景中,教育是增长最快、渗透超预期的赛道之一。字节跳动的Gauth自2020年推出以来,下载量超2亿次,成为现象级AI教育产品。字节随后将这套AI辅导能力带回国内,做成“豆包爱学”,更贴近国内学生的学习内容和使用习惯,现已更新到2.0。7月初,该产品与唐国强合作推出《出师表》系列互动课;在Seedance 2.5发布时,豆包爱学也被作为官方典型落地案例展示。 豆包爱学独立APP...
2026-09-18
智谱AI智能体两周让10万卡集群吞吐暴涨200%
RSI的最小闭环已经出现。智谱创始人兼首席科学家唐杰在X平台发表长文,首次曝出智谱在递归自我改进(RSI)领域的最新成果:在超过10万卡国产芯片组成的集群上,由GLM-5.3驱动的Infra Agent参与搭建了支撑GLM-5.3 Flash研发的生产级推理服务,仅用不到两周就完成从模型适配到生产可用的进化,将端到端吞吐提升至初始基线的3倍。唐杰认为,虽然距离递归式自我改进还很遥远,但最小闭环已经...
2026-09-18
红杉领投Mecka AI,估值5亿美元
据两位知情人士透露,专注于收集和分析人体运动数据以训练人形机器人及其他机器人的初创公司Mecka AI,即将完成由红杉资本领投的新一轮融资,估值约为5亿美元。此次融资距离上一轮仅过去三个月,此前该公司宣布完成由Framework Ventures领投的6000万美元融资,参投方包括Menlo Ventures、SV Angel和Kindred Ventures。 Mecka AI由四位联合创始人...
2026-09-18