谷歌发布两款实时语音模型,攻克语音Agent沉默难题
谷歌发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,称其为迄今最先进的实时对话模型,已在智能和并行推理方面重大升级,并通过 Gemini API 和 Google AI Studio 向开发者开放。

两款模型均面向语音 Agent,但分工不同:Gemini 3.8 Live 侧重低延迟和规模化部署,Extended Thinking 为多步骤推理、调用多个工具的复杂任务增加后台思考能力。

此次更新旨在解决语音 Agent 的常见问题:用户要求查数据、调用系统或完成预约时,对话往往停下来等待工具返回结果,语音通话中的几秒沉默让人难以判断模型是在思考、执行任务还是已失去响应。Extended Thinking 可在后台规划任务并异步调用工具,同时先给出“我来查一下”之类的语音回应,任务执行中还能口头报告进度,最后说出结果。这也改变了开发者判断“一轮对话结束”的方式,需根据 Live API 返回的 IN_PROGRESS 和 IDLE 状态判断任务是否真正完成。技术文档规定,Extended Thinking 的工具调用必须采用非阻塞方式,思考深度可设为低、中、高三级。Gemini 3.8 Live 也支持异步工具调用,但被定位为多数低延迟语音应用的默认选择。Extended Thinking 面向跨多个接口检索信息、分析日志排障、验证公式或辅导代码等任务。两款模型的区别并非简单的“普通版与加强版”,响应速度、任务复杂度和客户端能否正确处理后台执行状态都会影响选择。

两款模型还强调视觉输入能力。Gemini 3.8 Live 可在近乎实时的对话中处理用户展示的画面,结合语音问题作答,支持在对话中识别并切换 97 种语言。官方演示了模型一边观察棋盘一边与用户交流棋局的能力。开发者博客列出几项面向业务应用的能力:识别确认码、保险理赔编号等字母数字混合信息;将实时音频与结构化数据结合以更新回答依据;在持续输出语音时执行 API 调用。谷歌提示,视频帧默认会发送给模型,应按需提供画面以控制上下文占用和费用。两款模型均支持文字、图像、音频和视频输入,输入上限为 131072 Token,支持函数调用,但文档未将代码执行、文件搜索或结构化输出列为支持能力。
根据 Artificial Analysis 语音到语音榜单,Gemini 3.8 Live Extended Thinking 的 High 配置取得 82.6 分综合指数,该指数汇总语音推理、Agent 任务表现、用户偏好和任务成功率。具体项目中,该模型在 τ-Voice Agent 任务测试中取得 68.6%,在 Big Bench Audio 语音推理测试中取得 97.7%。谷歌披露,其在 Sierra 的 τ-Voice-banking 银行业务任务测试中取得 35.1%。基础版 Gemini 3.8 Live 在 Artificial Analysis 的 Speech Agent Arena 用户偏好榜中排名第二。这些数据说明语音模型竞争已不只是“说得自然”,但单项成绩不能直接推算企业部署后的完成率,开发者仍需结合自己的工具、数据和真实对话流程进行测试。
成本方面,谷歌将两款模型列在同一标准价格项下:付费档音频输入约 0.005 美元/分钟,音频输出约 0.018 美元/分钟;文字以及图像、视频输入另有计费项目。
此次发布引发社交平台热议。在 X 上,网友 Mike Kipruto 最想知道模型能否在后台运行任务的同时进行推理、使用工具并让对话继续。也有用户认为持续推出新模型尚未回答对模型质量的期待。KUMAR 希望未来 Gemini 4 或 4 Pro 减少设计内容里的“AI 味”及幻觉。Francesca A 认为用户需要的是能与 Claude、OpenAI 模型乃至 Kimi 3 相比的 Pro 或前沿模型,并称谷歌上一次推出有突破性的前沿模型还是 Gemini 2.5 Pro。模型可用性也引发讨论,Pear 称 Gemini 3.8 Flash High 过去两天无法正常工作,TLM13 抱怨最近三次使用 Google Studio 时系统反复尝试修复问题直至用完额度。在 Reddit 上,更多讨论集中在谷歌接连推出 Flash、Live 等模型,为何没有发布期待的新版 Pro 模型。用户 technopixel12345 称“他们要么藏着一个强大的 Pro 模型,要么就是远远落后了”。但也有人认为只盯着前沿模型榜单会误读谷歌策略。用户 bysse 判断谷歌最终可能“胜出”,理由是拥有全球基础设施,Gemini 具备多模态能力、价格较低且用途不限于编码。willitexplode 认为谷歌面向普通用户需要的是“快速、准确的智能”,未必需要把最强模型都作为公开产品提供。还有网友对演示效果提出批评,Hans-Wermhatt 对员工入职指导演示中语音助手主动描述用户当前页面的行为感到不满,认为模型应判断何时该说、何时该保持安静。
更多推荐阅读

AI末日论背后资本局:一边喊刹车一边冲IPO
电影《大空头》原型人物、投资人迈克尔·伯里公开抨击OpenAI、Anthropic等公司一边呼吁“给AI踩刹车”、一边推进IPO和融资的行为,称其“自私自利”“纯属炒作”。美国调查博主Kevin Bass则顺着资金链扒出一张关系网:Anthropic早期投资人Dustin Moskovitz同时通过慈善体系资助METR、Redwood Research等AI安全机构;而Dario推荐的第三方评估机...
2026-09-16
一句话让AI跑完100步,荣耀MagicOS 11发布
晚上下班,你正坐在地铁里玩手机,平时免打扰的明星粉丝群突然弹出消息:爱豆要开演唱会了。你对着手机说一句“帮我查一下这场什么时候开票,提前五分钟定个抢票闹钟”,再补一句“把他最近十首热门歌整理到备忘录里”。说完继续刷信息流。等你打开备忘录,歌单已整齐码好,抢票闹钟定好,场馆地址也塞进了日程。这就是荣耀MagicOS 11里AI助手YOYO的日常状态。 在今晚发布的MagicOS 11中,YOYO能...
2026-09-16
中国语音AI斩获多项全球第一
地铁急刹,金属尖叫,广播响起「请乘客注意扶稳」,人群骚动、孩子哭声、对讲机杂音一层层涌上来。你甚至能感觉到车厢在晃。这不是电影原声带,整段声音是用一句 prompt,AI 一次性生成的。 再来听一首歌。先是一段清唱,没有伴奏。然后 AI 接手,一句提示词——「一首温暖柔和的 City Pop 男声歌曲,带一点爵士和轻摇滚的感觉,氛围朦胧浪漫」——模型直接在这段清唱基础上,补齐了编曲、和声、节奏和...
2026-09-16
AI Dating是衡水中学:做题相亲,保结婚退款
由于古法时代在男人身上没拿到大结果,现在AI全面开花了,想看看现在的Dating App能不能帮我拿大结果。比如最近很能炒的良配。从知道良配到我真正用上,隔了一个月。号称精准匹配,注册过程漫长,AI红娘先盘问半小时,再填一堆资料,让我有种不吃苦就不配脱单的感觉。良配让我发现我还是一个看脸的人。逼我做半天题,把三观、家境、择偶要求摆出来,理论上应被这些信息打动,但实际我会快速过一遍照片,再返回去读字...
2026-09-16
国产算力爆发!中国气象预报拿下全球第一
中国气象局地球系统数值预报中心与中科曙光联合宣布,我国自主研发的下一代天气-气候一体化模式(MCV)达成里程碑成果:全球首次实现全球5公里分辨率、未来10天预报在1小时内完成计算,达到业务应用所需的关键时效。相比国际正式业务运行的全球预报系统,这一成绩超越欧洲中心IFS约9公里的最高水平,领跑欧美日等主流同行。该成果有望为气象防灾减灾、交通调度、能源运维、农业生产提供精细化预报。 MCV是中国气...
2026-09-16
GPT-6刷爆ARC考卷,ARC-AGI-5改考“发明”
GPT-6 Astra在ARC-AGI-3半私有测试集上拿下99.9%,OpenAI称该基准已完全“饱和”,导致ARC原定方案作废,ARC系列需重新拟题。ARC Prize创始人François Chollet披露下一代评测蓝图:ARC-AGI-4将于明年Q1登场,聚焦更长尺度下的持续学习与课程学习;被称为“人类最后考卷”的ARC-AGI-5已提上日程,完全围绕“发明”展开。他表示,当AI的学习效...
2026-09-16