谷歌深夜放大招:Gemini 3.8 Live语音模型登顶榜首
谷歌发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两个实时对话模型,称其为迄今最先进的实时对话模型。Extended Thinking 在 Artificial Analysis 语音质量榜以 82.6 分拿下总榜第一;在 ServiceNow 语音 Agent 测试中,两模型首次同时提升准确性与对话流畅度。

此前 AI 圈因泄密账号 Lyra 发布含 RSI(递归自我改进)暗示的推文、疑似谷歌内部模型配置截图及 Sergey Brin 推动 RSI 的传闻而沸腾一周,预期谷歌将发布重大模型,结果发布的是语音模型,引发调侃。但谷歌实现了过去语音 AI 未做到的事:说话、思考、后台干活三件事互不打断。

Gemini 3.8 Live 主打规模化和成本效率,整合对话智能、流畅度与视觉理解,适合大批量铺开;Extended Thinking 主打高复杂度任务,智能更高,支持多步推理。两者定位为可上生产的语音 Agent 基础组件。

主要改进:面对复杂问题,Extended Thinking 不再沉默,而是先用“Let me check that…”接住用户,再边推理边汇报进度;模型可先应下请求、继续聊天,工具调用和 API 请求放后台运行,开发者无需再拼接空白。支持 97 种语言,对话中途自动检测并切换语种,同声传译成默认能力;近实时视觉输入直接进对话,无需截图上传。谷歌演示让 Extended Thinking 当编程家教,实时看屏幕代码讲解。
成绩方面:Extended Thinking 在 τ-Voice 得 68.6%,略高于 GPT-Live-1 Astra 的 67.9%;在 Sierra 的 τ-Voice-banking 得 35.1%,对手为 32.0%;Big Bench Audio 97.7%。银行场景需核身份、查流水、改额度,一步错需重来,Extended Thinking 只办成三成多。标准版 3.8 Live 不卷难度卷成本,真人盲听投票排第二,谷歌称价格可控。
文章认为,AI 正成为 Agent 的实时界面,人机配合从“下指令、等结果”变为边聊边并行干活。谷歌将能力拆成四块零件:延迟压下来、后台能跑工具、边想边汇报、语言自动切。屏幕首次不再是人机之间的必经之路。
更多推荐阅读

把记忆交给CPU,大模型推理能快多少?
拿Agent做Coding已经很常见,但把目光移到背后的数据中心,事情就没那么简单了。一个Coding Agent改跨十几个文件的bug,需要反复读代码、查资料、跑测试。任务越跑越久,系统要处理的历史信息也越积越多。当成千上万个Agent同时干活,运营方就可能遇到一个头疼问题:服务器还在跑,能接住的并发却越来越吃紧,有些请求连吐出第一个Token都要等很久。 问题的根儿不在GPU,而在记忆。大模...
2026-09-16
MIT报告追问:AI时代,大学还值得上吗?
MIT与AI发展深度绑定,但如今它开始反思:AI会不会颠覆大学教育本身?在MIT一场教师听询会上,有人提出:既然AI Agent做研究助理又快又便宜,UROP(本科生研究项目)是否还要招学生?对经费紧张的实验室,这很难不心动;但对校长而言,必须回答大学为何要让学生花四年聚在一起。 2026年8月,MIT发布38页内部报告《AI在教学、学习与研究训练中的使用》,由五个学院的教授、学生和行政人员历时...
2026-09-16
机器人打拳跳舞一年了,何时能替我们上班?
机器人打拳跳舞火了一年,它什么时候才能替我们上班? 宇树发布人形机器人格斗演示,称首次实现由世界模型实时驱动的全自主搏击,UnifoLM-X2-1.0能实时预测未来状态,完成规划、决策和动态交互。但换成药房取放商品等场景,包装各异的药品、有人走动的货架通道、长时间运行中的意外,都是新难题。 APPSO在2026外滩大会现场与蚂蚁灵波CEO朱兴交流。谈到机器人为何连小卖部都未大规模落地,他直言:...
2026-09-16
菲尔兹奖得主联名警告AI数学错位
上周六,陶哲轩、邓煜、彼得·舒尔茨等25位菲尔兹奖得主联合发表声明《人工智能在数学中的严重错位》,引发广泛讨论。陶哲轩表示“事态紧迫”,未等待更广泛协商便先行发布。声明并不反对AI进入数学,而是反对AI公司把“攻克著名难题”当基准来刷,导致数学共同体真正在意的理解、概念和可复用思路被更容易量化的目标挤掉。 三天前,OpenAI宣布一个尚未发布的内部模型用约一万个智能体协同工作、耗时88小时,完成...
2026-09-16
OpenAI“Lily计划”曝光:你的ChatGPT聊天记录正被人工审核
美国当地时间9月14日消息,据外媒报道,OpenAI正在推进代号“Lily计划”的内部项目。数百名外包人员正阅读真实用户的ChatGPT对话内容,包括完整上下文记录,对回复进行评分和点评,其中不乏敏感个人隐私。审核人员核心任务之一是训练ChatGPT避免拟人化倾向并降低“讨好型”人格。对OpenAI而言,“过度讨好”已成核心隐患,多起诉讼指控GPT-4o因过度顺从用户,在一定程度上诱发多起自杀事件...
2026-09-16
英伟达点名的杭州团队,补上AI科研最后一公里
AI for Science的竞争,正在向科研闭环延伸。 以蛋白设计为例,蛋白模型虽越来越强,但真正设计一个分子,研究人员仍需查文献、找结构、下载权重、配置环境,再将计算任务送上服务器。模型给出结果后,还要换工具看结构、做筛选,判断哪些候选值得继续。一次计算跑完,下一步从哪里开始,往往仍靠人把各环节接起来。 如今,这些隐藏在模型前后的工作,开始被AI公司重新审视。今年4月,OpenAI推出面向...
2026-09-16