全国产算力语音识别大模型实测:能听懂上下文了

全国产算力语音识别大模型实测:能听懂上下文了

AI 资讯 来源:新闻/公众号 发布时间:2026-09-25 更新于 2026-09-25 预计阅读 4 分钟

智东西9月24日报道,科大讯飞推出最新语音识别大模型Spark-ASR-2.0,基于讯飞语音基座大模型Spark-Audio-1.0-Preview构建,重点提升通用识别、复杂声学场景识别、上下文识别和文本流畅规范性。两款模型均基于全国产算力训练。

目前多数语音识别模型在日常使用中基本能准确转写,但在嘈杂环境、中英文混合输入或专业会议转录时,仍可能出现错字、漏字,语气词、重复和临时改口也常需二次整理。智东西围绕四个方向对Spark-ASR-2.0展开实测,结果显示其整体识别表现稳定,能通过上下文修正歧义表达,减少口头语和重复内容,使转写结果更接近可直接使用的文本。

口语转录,一步到位!全国产算力语音识别模型,听得懂上下文了

该模型已陆续上线讯飞输入法,并通过讯飞开放平台提供API服务,后续还将应用于讯飞AI眼镜、智能办公本和讯飞听见等产品。

通用识别方面,Spark-ASR-2.0支持全国202种方言免切换识别,河南话测试中几乎瞬间完成正确识别。中英文混合场景下,一段包含RISC-V、TPU、VISA等英文缩写和芯片术语的业务介绍被完整识别,专业词汇无出错。复杂声学场景中,地铁噪音下模型能区分环境声与说话声,识别出“一号线”“东单”等关键信息;悄悄话测试中,压低音量使用气声说话仍可准确识别完整内容。

口语转录,一步到位!全国产算力语音识别模型,听得懂上下文了

上下文识别方面,模型能根据后文“山峰的峰”判断“张三峰”的正确写法,也能结合后文解释将易混淆的“灵”和“苓”调整为正确文字。文本流畅性方面,面对停顿、重复、改口,模型能删去冗余内容,将会议时间修正为“8点半”,邮箱按正确格式输出;加入日期、取件码、快递单号等信息后,均准确识别且输出规整,可直接使用。

Spark-ASR-2.0的升级建立在讯飞语音大模型持续演进基础上。9月16日,科大讯飞推出基于全国产算力训练的语音基座大模型Spark-Audio-1.0-Preview,支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析及复杂音频问答等任务。Spark-ASR-2.0基于该底座打造,聚焦准确性、实时性、语言理解和文本规范。

口语转录,一步到位!全国产算力语音识别模型,听得懂上下文了

去年1024开发者节首发的非自回归语音识别大模型Spark-ASR-1.0,实现推理效率大幅提升,效果相对提升16%,推理成本下降84%。官方测试显示,Spark-ASR-2.0在核心场景效果较Spark-ASR-1.0进步明显,绝大多数场景WER低于业界最优水平,方言、高噪和小音量场景表现最突出。

为解决识别效果、响应速度与推理成本的平衡问题,Spark-ASR-2.0延续非自回归识别能力,同时融合LLM增强的自回归识别能力:先由非自回归模块快速生成整段识别结果,再通过投机解码判断需结合上下文修正的内容及起点,避免全文重新解码,整体推理成本较Spark-ASR-1.0仅增加10%。针对中英文混合数据匮乏问题,模型通过补充英文专有词与热词形成混合文本数据,结合语音特征和发音相似性联合训练。上下文识别方面引入动态上下文注入机制,结合当前语音、个性化热词和用户历史修改,从万级热词库筛选候选词,基本不增加响应时延。

科大讯飞长期深耕智能语音技术,曾连续六届获语音识别国际权威赛事CHiME冠军。2024年,其作为第一完成单位的“多语种智能语音关键技术及产业化”项目获国家科学技术进步奖一等奖。从推出语音基座模型到发布语音识别大模型,讯飞持续推动语音技术应用落地。

标签: AI 资讯 AI

更多推荐阅读

AI替你干活后,谁还为你成长买单?

AI替你干活后,谁还为你成长买单?

一个人还在学习的现场,工作却已经可以绕过他完成。 在机器人手术室里,主刀医生坐在控制台前操纵机械臂,年轻住院医师却可能只负责清除烟雾和积液,或坐在另一台控制台前观看。研究技术与工作的学者马特·贝恩用两年多时间观察发现:传统手术往往需要两个人、四只手,年轻医生参与其中也就有了练习机会;机器人让专家可以独自操作,学徒成了可选项。 这里的“可选”比“被替代”更值得深思。年轻医生没有被赶出手术室,仍能...

2026-09-25
实时世界模型PixVerse R2走红 用户可实时操控剧情走向

实时世界模型PixVerse R2走红 用户可实时操控剧情走向

从“看视频”到“操控世界”,一款实时世界模型近日在海外走红。9月22日上线当天,爱诗科技(AIsphere)最新发布的实时世界模型PixVerse R2登上X(Twitter)趋势榜第二。有海外网友认为,这标志着AI生成从“创作视频”转向“与AI世界互动”,不像是看视频,更像是身临其境。 在PixVerse R2创造的世界中,用户可以移动、说话、做出选择。每一个提示词、每一个动作,都会实时改变眼...

2026-09-25
高通骁龙新芯片为AI Agent重新设计

高通骁龙新芯片为AI Agent重新设计

北京时间9月23日,在2026骁龙峰会上,高通CEO安蒙正式介绍面向Agent时代的战略转型,并发布两款新一代旗舰手机SoC:第六代骁龙8超级至尊版与第六代骁龙8至尊版。两款芯片均采用台积电2nm制程,搭载自研Oryon CPU,8核配置,包括两颗最高5GHz的Prime核心和6颗最高4GHz的Performance核心,为业界首次将手机CPU主频提升至5GHz。高通首次在同一代骁龙8 Elite...

2026-09-25
DeepSeek梁文锋署名论文:沙盒如何开启RSI闭环

DeepSeek梁文锋署名论文:沙盒如何开启RSI闭环

DeepSeek联合清华大学发表论文《DeepSeek Elastic Compute(DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale》,9月19日提交arXiv,编号2609.22978,作者超130人,梁文锋署名最后一位。 论文核心是公开DeepSeek训练Agent所用的沙盒平台DSec。训练A...

2026-09-25
昇腾超节点破三堵墙,十万亿大模型训推最优解

昇腾超节点破三堵墙,十万亿大模型训推最优解

2026年AI圈的关键词是“智能体”。AI从能聊到能干,推理需求指数级爆发,预计2030年全球每月Token消耗超120千万亿,暴涨24倍。顶级MoE模型参数量达十万亿级,训练压力同步增长。传统服务器难以应对,超节点成为行业公认的更优路径,可解决“存储墙”和“通信墙”,但真正商业化落地者很少。 昇腾950超节点在华为全联接大会2026期间正式上市,成为业界最大规模商用超节点,包括Atlas 95...

2026-09-25
代码生成提速后,软件交付瓶颈转向何处?

代码生成提速后,软件交付瓶颈转向何处?

2026年9月22日,阿里巴巴集团CEO吴泳铭在杭州云栖大会演讲中提出,机器正成为思考的主力,智能正成为规模化商品,未来机器思考总量将达人类1000倍以上。与技术底座演进同步,阿里研发方式加速向AI Native转变,Agent不再只用于生成代码,而是进入需求、开发、测试、发布和运维各环节。 9月23日,“智启原生 研见未来”阿里巴巴集团AI Native研发实践论坛在云栖大会举办。机器之心主编...

2026-09-25
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部