谷歌TPU推理成本反超英伟达,黄仁勋三次断言被数据打脸
英伟达死守的推理性价比神话被打破。SemiAnalysis发布谷歌第七代TPU Ironwood首份第三方推理性能测算:在完全对等负载下,TPU每美元性能最高领先B200达50%,对B300领先幅度达96%。每百万Token成本,TPU仅0.181美元,B200为0.222美元,B300高达0.276美元。
今年4月,黄仁勋曾在播客中称TPU与Trainium不敢跑分,并鼓励挑战者用InferenceMAX证明推理成本优势。五个月后,TPU带着数据如约而至。测试方法公平:同款开源模型,FP8对FP8,输入8k输出1k,B200与B300跑与TPU完全一致负载。在每秒100 Token单用户吞吐基准下,TPU比B200便宜19%,比B300便宜34%。若中位响应时间卡在20秒,TPU成本0.098美元,B200为0.106美元,B300为0.132美元。B200仅在30秒响应时间狭窄区间维持微弱抵抗,B300全程成本劣势。

黄仁勋曾称从第一性原理看TPU优势毫无道理。物理测试未推翻其底层推演,但他算错了商业账。TPU原始吞吐曲线大部分区间物理性能确实不及GPU,但每小时租赁成本断崖式低廉。5%物理吞吐优势叠加极低单位时间租金,转化为50%每美元性价比优势。若按谷歌内部每颗芯片一小时1.03美元底线成本核算,优势放大至77%乃至130%。黄仁勋计算单芯片绝对算力,客户衡量的是每张钞票的实际产出。
黄仁勋还断定Anthropic只是特例,失去支撑TPU将丧失增长引擎。该断言仅表面成立。Anthropic确实吞下超100万颗TPU,约40万颗买断,60万颗通过谷歌云租赁,到2029年将超越DeepMind成为全球最大TPU单一用户。但另一半正迅速失效:谷歌自去年起开放芯片直售,不再死守云端租赁。黄仁勋4月敢那么说,是因为TPU从未对外标价。现在价标出来了,还是别人替谷歌标的。

TPU如何实现成本倾轧?SemiAnalysis揭示谷歌工程哲学:不单一追求物理峰值,而是将计算Die、芯片间互联及底层编译器铸成闭环系统,在每处接缝压榨成本。Ironwood拆为两个独立计算Die,每颗内嵌2个TensorCore与4个SparseCore,HBM容量达上代Trillium的6倍,决定KV Cache与Batch大小。它是首代原生支持FP8的TPU,矩阵单元采用256×256脉动阵列,每周期完成65536次乘加,吞吐量达v5架构4倍。第八代将训练和推理拆成8t、8i两颗芯片,8i片上SRAM扩至384MB,为上代3倍,专将推理模型KV Cache留在片上。
网络互联方面,芯片间通过自研ICI总线交互,绕开主机CPU、PCIe与通用网卡。拓扑呈3D Torus,每颗芯片物理链接6个相邻节点,64颗组建机架级立方体,再通过光学电路交换机拼接至9216颗芯片超级矩阵。任一光纤链路故障,系统可利用光学反射镜数秒内重路由。到TPU 8i,3D Torus换成Boardfly拓扑,千颗芯片规模下最大跳数从16砍到7,MoE路由和多轮Agent尾延迟减半。

性能表现潜藏于底层软件重构。谷歌、Inferact与RadixArk联手投入数百工程小时,萃取三项决定性优化。第一,KV Cache页数翻倍,削减首Token延迟。旧注意力内核沿头维度打包KV,导致单KV头模型一半计算资源被补零吞噬。现将Token转移至128 Lane维度,可用KV页从5141暴涨至10283,并发128时吞吐提升16.5%,中位首Token延迟骤降95%。第二,参数拆解提升解码吞吐。旧启发式算法将计算块和读取块均锁定16k Token,VMEM无空间预取。现将读取块维持16k,计算块砍至4k,解码吞吐从每秒64.9k Token跃升至96.3k。第三,通信任务向SparseCore转移。Ironwood每颗芯片4个SparseCore原专属于Embedding查表等稀疏计算,现将ReduceScatter和MoE Token重排任务全部转移,释放TensorCore专注矩阵乘法。8k输入1k输出负载下吞吐提升4.1%至14.2%,1k输入8k输出并发512时吞吐暴增26.1%。数百个微小优化累加,铸就压倒性50%性能优势。
最颠覆之处在于谷歌只动了软件。开源推理生态此前深扎PyTorch与CUDA,TPU原生环境是JAX。此前vLLM跑TPU需靠TorchAX翻译墙,逐算子翻译为JAX执行,导致分页注意力与底层优化大量兼容问题,谷歌联合开源社区耗时一年多修补。如今TorchTPU直接炸毁翻译墙,利用PyTorch自带PrivateUse1后端接口,令TPU直接成为原生Torch计算设备。开发者仅需一行代码将编译交由XLA处理,性能核心算子调用Pallas内核,DDP与FSDP2等分布式特性无缝运转。vLLM和SGLang等框架调度器与API层核心代码可直接复用。CUDA帝国城墙
更多推荐阅读

AI每周三晚7点直接给你安排约会,已获920万美元融资
过去十几年,约会 App 形成了成熟逻辑:先看照片,右滑左滑,匹配后聊天,再约见面。Tinder、Bumble、Hinge 基本都没跳出这套流程。但美国两个伯克利辍学生做的产品 Ditto,把这套流程删得差不多了。 Ditto 没有照片瀑布流,不需要不停刷人,也没有匹配列表,甚至不鼓励匹配后先聊几天。用户只需给 iMessage 号码发消息,告诉 AI 自己是谁、喜欢什么样的人。每周三晚 7 点...
2026-09-10
开源项目Memmy打通所有Agent记忆,换工具不用重新投喂
短短半年,我电脑里已经装了七八款Agent,但真正常用的只有一两款,其它尝鲜后都慢慢吃灰了。用惯一个Agent后很容易养成依赖,里面有聊过的方案、改过的要求,还有做到一半的项目。但总有必须换着用的时候。比如项目做到一半,Claude Code额度不够,想让Codex接着干,可之前聊过的细节它全不知道,还得整理聊天记录重新投喂,本来只是想换个工具继续干活,结果先给自己加了一道整理资料的工序。 不过...
2026-09-10
苹果AI未至,Apple Watch先成个人智能中枢
曾几何时,Apple Watch 和 AirPods 被苹果定义为「配件」类产品。但在今年这个苹果面向 AI 转型的关键年,这些产品扮演了前所未有的重要地位。不只是 iPhone,连过去的配件也要自我进化,成为「AI 硬件」。 苹果在秋季新品发布会上带来了 Apple Watch S12 与 Ultra 4,这是今年 iPhone 之外更新最大的硬件产品。苹果将手表定义为与用户更亲密的「个人智能...
2026-09-10
27岁AI研究员辞职:担心AI致人类灭绝
昨天,Jacob Coxon在X上发帖,流量过亿。他27岁,英国人,数学出身,曾两次入选英国国际数学奥林匹克竞赛队伍,后进入剑桥大学Trinity College学数学。2021年参与过一篇eLife医学统计论文。2023年左右加入OpenAI,是GPT-4o官方贡献者,GPT-4.5核心贡献者。今年从OpenAI去了Anthropic,继续做大模型预训练,但很快辞职。原因是他认为OpenAI和A...
2026-09-10
神秘模型Omen Alpha实测:25分钟速搓“牛来”版YouTube
智东西9月9日报道,匿名模型Omen Alpha近日突然出现,凭借超高性价比迅速引发热议。上线5天后,在免费模型Muse Spark 1.3 Contributor冲击下,仍高居OpenCode调用量榜单第七,被网友称为“又是来自东方的神秘模型”。社区测试中,开发者普遍反馈“快”,有人仅用1小时30分钟完成简易3D世界建模,而用GLM 5.3 Flash和GPT 5.6 Luna以同样提示词开发用...
2026-09-10
DeepSeek V4.1 Flash上线:552B MoE模型全面超越V4 Pro
周四上午,DeepSeek V4.1 Flash 正式在网页、App 和 API 端全面上线。官方称其在性能、响应速度、效率等核心指标上全面超越 V4 Pro,采用新架构并原生支持多模态。 V4.1 Flash 是一款总参数 552B 的 MoE 模型,采用全新 Causal-Encoder-Decoder 架构,输入与输出采用非对称计算设计:输入侧仅激活 8B 参数,输出侧激活 16B 参数,...
2026-09-10