中英混说1小时不卡壳,Meta实时语音转写模型如何炼成
Meta近日推出首个实时音频感知模型Muse Voice Transcribe,由超级智能实验室开发。该模型提供实时流式自动语音识别(ASR),支持超过20位说话人的语音分割及端点控制,可处理超1小时长音频,并实现无缝语码切换。官方示例显示,其对中文、中式英语及中英混说的转写速度和效果俱佳,堪称“中英混说1小时无压力”。

从独立工具到实时感知层

语音转写正从独立工具演变为AI系统的实时感知层。Meta此次发布的Muse Voice Transcribe,正是这一趋势的典型代表。该模型在Artificial Analysis流式语音转文本和公开语音分割基准测试中排名第一(截至2026年近日),可通过Meta Model API、Mac版Meta AI和Muse Code使用,API定价为每1000分钟3美元(约合人民币20元)。

模型已使用70多种语言训练,其中25种语言经全面验证,初始版本建议用户试用这25种语言。其原生支持任意语码转换,利用上下文信息提高准确率,并支持超1小时长音频和20位以上说话者,无需后处理。Meta AI和Muse Code的语音听写功能可一键调用该模型,用户按住“Fn”键即可与屏幕上的任何窗口配合使用。

技术内核:80ms音频片段与自适应延迟

技术上,Muse Voice Transcribe是Muse Spark系列的自回归多模态模型。音频以80ms为单位处理,每个片段转换为软token,模型决定继续监听或输出文本token。音频流停止时插入特殊token告知模型,模型随即输出剩余文本。模型通过强化学习实现“自适应延迟”,根据单词难度动态调整等待时间,在词错误率和延迟间实现帕累托最优。
基于流式ASR,模型引入特殊token支持说话人分割和端点检测。说话人切换时预测<|start_of_turn|>token,并用<|speaker_{A-Z}|>区分说话人;语音开始和结束分别由<|speech_onset|>和<|speech_endpoint|>标记。Meta使用流式ASR联合训练这些任务,并增加额外奖励信号。
多语言与长音频的实战表现
在官方示例中,模型对中文、中式英语及中英混说的转写表现出色。例如,当说话人用中文夹杂英文单词或短语时,模型能准确识别并输出对应文本,且延迟极低。这得益于其原生支持任意语码转换的能力,以及利用上下文信息提高准确率的设计。对于超过1小时的长音频,模型无需分段处理,可一次性完成转写,并准确区分20位以上的说话人。
未来竞争:低延迟与多说话人理解
Meta此次发布的模型,标志着语音转写技术进入新阶段。未来竞争将聚焦低延迟、长上下文、多说话人、多语言及语境理解,并最终与大模型推理、记忆和工具调用融合,使系统不仅“听见”,还能理解谁在说、何时说完及上下文关联。Muse Voice Transcribe的推出,为这一融合提供了基础能力,也让实时语音交互的想象空间进一步打开。
更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速
理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。
2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启
2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。
2026-09-05
AI报告读着累?新指标用隐喻率量化可读性
Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。
2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%
Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。
2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿
Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。
2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明
Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。
2026-09-05