蚂蚁清华开源9B模型Realtime-Venus:AI边聊边办事
AI实时交互存在一个常见难点:查资料、跑任务需要时间,用户却常在此期间继续追问或补充信息。如何边处理任务边听懂并回应用户新需求,是对AI助手的一大考验。近期,TML-Interaction-Small、SeedRealtime及Qwen-Omni-Realtime相继推出闭源方案。蚂蚁AI安全实验室与清华大学人机交互实验室联合发布Realtime-Venus,通过开放模型权重与代码,将全双工交互与后台任务委托能力开放给开发者,支持自主部署、定制与扩展。
系统包含Omni和Audio两款能边听边说的全双工交互模型,参数量均为9B。遇到需要外部能力的任务,模型可委托后台处理,再将结果带回对话,用户在此期间仍可插话、追问或补充需求。Realtime-Venus将主动感知和对话控制交给前端模型,通过配套Harness连接后台服务,让任务执行与对话同时进行。Omni还可借助外部记忆检索历史视听信息。

主动交互方面,模型持续接收画面和声音,在关键事件发生前保持倾听,并根据新事件判断是否开口。用户只需交代任务,不必反复追问。Realtime-Venus采用主动全双工交互,让模型说话时继续接收输入,结合语义判断何时续说、何时让出话语权。团队用Full-Duplex-Bench v1.5评估,在用户附和、用户转而对他人说话、背景出现人声三类应继续回应的场景中,Realtime-Venus-Audio续说率分别为97%、88%和86%,均高于Gemini 3.1 Live和GPT-4o。面对用户真正打断,Audio响应率为75%,与闭源模型仍有差距。
后台执行任务时,前端模型可通过Delegate机制,用自然语言描述任务并委托后台处理,等待结果期间仍能与用户对话。Realtime-Venus-Harness负责连接前端模型与后台服务,处理任务上下文、后台执行和结果交付。委托发起时,Harness保存当时可用的对话与视听证据并绑定到任务上,用户之后可继续补充需求,已发出任务保留发起时上下文。任务交给已注册的后台能力执行,包括多模态感知、通用推理或自定义技能。结果返回后,Harness整理成适合口头表达的回复送回原会话,前端模型结合当前交互状态选择播报时机。系统还记录排队、执行中、已完成、交付中和已送达等任务状态。

针对长视频中早先画面移出上下文窗口的问题,Realtime-Venus-Omni配备长视频记忆模块,无需额外训练或更新参数。系统根据视觉变化等信号筛选历史画面,保留与视频时间线对齐的音频,收到问题后结合语义相关性与画面新颖度检索证据,取回相关画面及邻近音频,与近期视听内容一起重新组织上下文。引入记忆模块后,Omni在LVOmniBench的60至90分钟视频子集上准确率从41.18%升至47.06%,增加5.88个百分点;在LongVideoBench的40至60分钟子集上从57.14%升至61.90%,增加4.76个百分点。
视频理解方面,Realtime-Venus-Omni在八项视频基准中的六项取得最高分,其中StreamingBench为70.2%,OVO-Bench为64.7%,Daily-Omni为81.3%。音频理解方面,Realtime-Venus-Audio在MMAU和MMAU-Pro上得分分别为78.0%和63.2%,均为参评模型最高水平。语音问答方面,Llama Questions得分为83.8%,Speech CMMLU得分为67.8%,均领先;VoiceBench AlpacaEval得分为4.81,并列最高。工具使用方面,在Full-Duplex-Bench v3中,Omni与Audio的工具选择F1分别为86.0%和82.0%,分列第二、第四,Omni仅次于GPT-Realtime。两款模型完整任务成功率Pass@1分别为43.0%和42.0%,参数准确性和多步执行仍有提升空间。两款模型均基于MiniCPM-o 4.5构建,分别独立训练,后训练语料总量超过280万条,涵盖九类数据源。

清华大学计算机系长聘教授、人机交互实验室负责人史元春表示:“人机交互的终极目标,是让机器像人一样自然地理解和回应我们。Realtime-Venus让AI助手在‘想’的时候还能‘听’,在‘做’的时候还能‘说’——这朝着人机共生迈出了一步。但自然的交互不止于听和说,还包括理解上下文、预判需求、在合适的时机交付结果。从‘能交互’到‘会交互’,我们还有很长的路要走。”
现有评测也给出后续改进方向:模型对用户真正打断的响应仍需改善,工具调用要提高参数准确性和多步执行成功率。进入更长时间连续交互后,如何保留有用信息、在任务失败后恢复,还需更多验证。团队接下来将继续探索更细粒度的流式交互和更长上下文窗口,并研究复杂任务的执行与恢复。开源之后,开发者可接入自己的业务工具,在实际使用中检验对话节奏和任务完成情况。
更多推荐阅读

模型不够强,灵巧手才要卷性能?源升智能杨思成谈机器人操作
灵巧操作的最高境界,是“无剑胜有剑”。在源升智能创始人杨思成看来,灵巧手之于机器人操作能力,就像兵刃之于剑术,模型越强,就越不依赖末端执行工具;反之,模型能力不够强时,就需要灵巧手加持才能更好完成任务。 杨思成在清华时期便专门研究灵巧操作,2018年加入腾讯Robotics X实验室,担任灵巧手项目总负责人。2024年,他成立源升智能,开启灵巧手创业。他认为,现在行业都在打造“神兵利器”——更多...
2026-09-27
中国最强AI芯片发布,平头哥再开源软件栈
9月22日云栖大会上,阿里巴巴CEO吴泳铭介绍新一代真武V900,称其是目前中国算力性能最强的AI芯片,性能达M890的3倍。但客户换用真武,还需确认原有代码、工具和开发经验能否迁移。芯片之外,软件生态同样决定客户选择。 9月23日,平头哥公布AI软件栈T-Head SAIL最新开源进展,扩大框架适配、加速库、工具链和通信库等开放范围。平头哥将AI芯片比作发动机,软件栈则是“变速箱+传动系统+驾...
2026-09-27
华为大模型双子星创业,要做物理世界的Scaling Law
数亿元资金,投向了一场物理世界的基模实验。Physical AI创业公司息壤开物宣布,已连续完成数亿元种子轮及天使轮融资,由敦鸿资产领投,华控基金、三花控股、银杏谷资本、泽然资本、本坚基金、天使基石、标朴投资等跟投,估值达5亿美金。 公司创始人、CEO李寅,前华为云大模型CTO,华为大模型0-1阶段核心成员;联合创始人张含望教授,前华为多模态首席科学家。二人联手,瞄准具身智能尚未解决的底层难题:...
2026-09-27
前OpenAI研究员:Jev出现前AI世界是悲剧
“它会逐渐退到软件背景中,像数据库、正则表达式或其他基础设施一样,成为开发者随手调用的普通能力。”这是 TypeSafe CEO、Jev 创始人 Diogo Almeida 对 AI 的设想:当智能真正融入软件,用户甚至不必意识到它的存在。但怎样才能让开发者放心地把判断交给 AI,而不用守在旁边反复检查? 几个月前,在 AI Engineer 大会的演讲中,这位曾参与 OpenAI Instru...
2026-09-27
Opus 5.5与GPT-6被指偷师中国AI团队
所谓“天下文章一大抄”。刚发布的Opus 5.5和GPT-6 Luna,身上满是姚顺雨和梁文锋的影子。两家公司预训练已做到极致,为提升智能、降低算力成本,都选择开辟新战场:Opus 5.5对上下文动手,GPT-6 Luna对缓存动手。 **阿莫迪偷师姚顺雨** 在Artificial Analysis智能指数中,Claude Opus 5.5在max档位下平均每题输出11.9万token,其中...
2026-09-27
OpenAI Codex负责人揭秘:从内部工具到顶流,终极目标不只是写代码
过去两年,AI编程最明显的变化,不是“代码写得更快”,而是软件开发本身正在被重新定义。从只能补全几行代码的Copilot,到今天能读懂代码库、调用工具、执行测试、提交修改,甚至持续运行数小时乃至数天的Coding Agent,模型正从“辅助工程师写代码”进入软件工程的完整生命周期。真正变化的已不只是效率,而是人和代码之间的关系:当正确性检查、安全审查、依赖升级、重构乃至部分架构工作逐渐自动化,人类...
2026-09-27