中国语音AI斩获多项全球第一
地铁急刹,金属尖叫,广播响起「请乘客注意扶稳」,人群骚动、孩子哭声、对讲机杂音一层层涌上来。你甚至能感觉到车厢在晃。这不是电影原声带,整段声音是用一句 prompt,AI 一次性生成的。
再来听一首歌。先是一段清唱,没有伴奏。然后 AI 接手,一句提示词——「一首温暖柔和的 City Pop 男声歌曲,带一点爵士和轻摇滚的感觉,氛围朦胧浪漫」——模型直接在这段清唱基础上,补齐了编曲、和声、节奏和完整制作。从干巴巴的清唱,到一首有呼吸感的完整歌曲。你能听出来这是 AI 做的吗?

过去两年,语音 AI 赛道非常热闹。Suno 刚发布 v6 系列,OpenAI 的 GPT-Realtime-2 把实时语音推理拉到 GPT-5 级别,Google 把 Gemini Live 推到 70+ 语言流式翻译。但几乎所有玩家都在比单项:语音合成比谁更像真人,语音识别比谁更准,音乐生成比谁更好听,实时对话比谁更快。然而现实中的语音需求从来不是孤立的点。一条短视频声音制作,需要配音、音效、背景音乐,可能还要先转文字做理解;Voice Agent 要跑起来,识别、生成、实时交互、推理、工具调用得同时在线;音乐创作者可能先有一段清唱,需要 AI 补上编曲和制作。这些对应的不是单个模型,而是一组能力。
这正是行业正在发生的结构性变化:当单点能力逐渐拉平,决定竞争力上限的,是谁能把理解、生成、交互和创作连成完整体系。

9 月 15 日,阶跃星辰放出 StepAudio 3 系列五款模型:TTS、Gen、Realtime、ASR 和 Music,覆盖「听、说、理解、交互、创作」全链路。这在国内音频大模型领域,是第一家以完整矩阵形态同时推出的。它反映出阶跃的判断:单项能力竞赛的窗口期正在关闭,全栈体系化能力开始成为真正的壁垒。
第三方榜单先给了答案——三个全球第一。Artificial Analysis Conversational Dynamics 榜单,StepAudio 3 Realtime 以 98.9% 综合得分全球第一,测的是对话节奏感:什么时候该接话,什么时候该等,用户插一句是想打断还是附和。Speech Reasoning 榜单,它以 99.7% 的语音推理准确率位列全球第一,考的是模型能否直接「听」懂音频并完成复杂推理,而非先转文字再想。非流式语音识别准确性榜单,StepAudio 3 ASR 的 WER 仅 1.7%,并列全球第一,意味着差不多 60 个词才错一个,接近专业速记员水准。

语音模型的基础能力正在快速成熟,但「识别准确」「声音自然」「响应够快」已不足以构成完整体验。真正拉开差距的,是模型能否接近真实人类交流:听懂语境、自然表达,并在持续对话中完成理解、回应和行动。
StepAudio 3 TTS 从「声音自然」走向「表达自然」。多数 TTS 已能把声音做得很像真人,但像的是「播音员」,字正腔圆,完美得不像在说话。真实交流是「呃」、是「就是那个」、是说到一半改口、是突然笑出来又收住。StepAudio 3 TTS 能还原笑声、迟疑、结巴、改口等副语言特征,把「音色像不像」推进到「说话方式像不像」。前代 StepAudio 2.5 TTS 已在 Artificial Analysis Speech Arena 拿下国产第一、全球前三。
StepAudio 3 ASR 从「听清」走向「听懂」。传统 ASR 只依赖声学信息,容易把「骁龙8至尊版」转成「小龙八至尊版」。StepAudio 3 ASR 把高精度声学建模和大语言模型语境理解结合,识别时调用语言模型知识辅助判断。方言、口音、中英混说、耳语、快语速、唱歌和有背景音乐的场景都能处理,长音频支持端到端完整理解。实测中,用 StepAudio 3 Gen 生成机场背景音,再让 ASR 去听,40 秒音频里「MU 5127」「C17」「C31」「18 点 45 分」等字母数字混排信息一个没错。AI 生成的声音能被 AI 准确听回来,说明两端质量都立得住。当 ASR 从转写工具进化为语音理解基础设施,产业价值完全不同。
StepAudio 3 Realtime 从「能打断」走向「边聊边想边做」。全双工、打断、低延迟已是桌面赌注,真正拉开差距的是模型能否在持续对话中同时处理理解、回应、推理和行动。它的做法是推理与语音生成并行,工具调用和长任务异步执行,不阻塞当前对话,任务完成后自然接回上下文,同时能感知语气、情绪、副语言和环境声音。实测中,一分钟内连续改口四次,每次掐在 AI 刚开口时打断,从人出声到 AI 闭嘴几乎即时,没有念完半句话的尴尬尾巴;停下后不重启话头,只确认变化的那一条;把「直达」说成「直飞」也能理解;整段下来没有擅自「预订」,规则守得很稳。
更多推荐阅读

AI末日论背后资本局:一边喊刹车一边冲IPO
电影《大空头》原型人物、投资人迈克尔·伯里公开抨击OpenAI、Anthropic等公司一边呼吁“给AI踩刹车”、一边推进IPO和融资的行为,称其“自私自利”“纯属炒作”。美国调查博主Kevin Bass则顺着资金链扒出一张关系网:Anthropic早期投资人Dustin Moskovitz同时通过慈善体系资助METR、Redwood Research等AI安全机构;而Dario推荐的第三方评估机...
2026-09-16
一句话让AI跑完100步,荣耀MagicOS 11发布
晚上下班,你正坐在地铁里玩手机,平时免打扰的明星粉丝群突然弹出消息:爱豆要开演唱会了。你对着手机说一句“帮我查一下这场什么时候开票,提前五分钟定个抢票闹钟”,再补一句“把他最近十首热门歌整理到备忘录里”。说完继续刷信息流。等你打开备忘录,歌单已整齐码好,抢票闹钟定好,场馆地址也塞进了日程。这就是荣耀MagicOS 11里AI助手YOYO的日常状态。 在今晚发布的MagicOS 11中,YOYO能...
2026-09-16
AI Dating是衡水中学:做题相亲,保结婚退款
由于古法时代在男人身上没拿到大结果,现在AI全面开花了,想看看现在的Dating App能不能帮我拿大结果。比如最近很能炒的良配。从知道良配到我真正用上,隔了一个月。号称精准匹配,注册过程漫长,AI红娘先盘问半小时,再填一堆资料,让我有种不吃苦就不配脱单的感觉。良配让我发现我还是一个看脸的人。逼我做半天题,把三观、家境、择偶要求摆出来,理论上应被这些信息打动,但实际我会快速过一遍照片,再返回去读字...
2026-09-16
国产算力爆发!中国气象预报拿下全球第一
中国气象局地球系统数值预报中心与中科曙光联合宣布,我国自主研发的下一代天气-气候一体化模式(MCV)达成里程碑成果:全球首次实现全球5公里分辨率、未来10天预报在1小时内完成计算,达到业务应用所需的关键时效。相比国际正式业务运行的全球预报系统,这一成绩超越欧洲中心IFS约9公里的最高水平,领跑欧美日等主流同行。该成果有望为气象防灾减灾、交通调度、能源运维、农业生产提供精细化预报。 MCV是中国气...
2026-09-16
GPT-6刷爆ARC考卷,ARC-AGI-5改考“发明”
GPT-6 Astra在ARC-AGI-3半私有测试集上拿下99.9%,OpenAI称该基准已完全“饱和”,导致ARC原定方案作废,ARC系列需重新拟题。ARC Prize创始人François Chollet披露下一代评测蓝图:ARC-AGI-4将于明年Q1登场,聚焦更长尺度下的持续学习与课程学习;被称为“人类最后考卷”的ARC-AGI-5已提上日程,完全围绕“发明”展开。他表示,当AI的学习效...
2026-09-16
特朗普突袭连线黄仁勋:AI恐慌是骗局
在洛杉矶All-In峰会现场,黄仁勋演讲时接到特朗普来电并按下免提。特朗普在电话中称AI恐慌论是“骗局”,表示数据中心让人们和各个州变得富有,是未来20到25年的石油。他强调机器人不会接管一切,AI也不会接管整个世界,并称“我们绝不会让这种情况发生”,但也补充必须审慎行事,并非停止一个产业,同时表示完全支持黄仁勋。黄仁勋回应称不会让AI减速发生,将确保美国AI竞赛中每个行业、公司、州和个人都是赢家...
2026-09-16