谷歌TPU跑Kimi比英伟达GPU快57%,代码已开源

谷歌TPU跑Kimi比英伟达GPU快57%,代码已开源

AI 资讯 来源:新闻/公众号 发布时间:2026-09-26 更新于 2026-09-26 预计阅读 5 分钟

16块谷歌TPU v7跑Kimi K3,每秒跑出709个Token,比英伟达GB200快57%。做出这一成绩的是推理创业公司Inferact,其创始团队为vLLM原班人马,今年获a16z领投的1.5亿美元种子轮,估值8亿美元。

Inferact为TPU编写了名为megakernel的推理内核,将模型推理时原本需调度的几百个小程序合并为一个大程序,配合TPU片上内存架构,把内存带宽利用率逼至硬件理论峰值附近。再配上DeepSeek提出的DSpark推测解码框架,K3在TPU上实现每秒709 token。该代码已开源。

谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架

测试在完全相同条件下进行:16块TPU v7 Ironwood对阵16块英伟达GB200,均跑Kimi K3、均用vLLM推理引擎,唯一变量是芯片和底层kernel实现。TPU每秒709个token,GB200每秒452个,TPU快57%。DSpark原理是让小模型先猜一串候选token,大模型批量验证,猜对跳过、猜错回退。Inferact在TPU上跑通该流程,acceptance length达6,单步decode耗时约8.5毫秒。

关掉推测解码看裸速,差距同样明显。batch size为1时,TPU每秒249个token,GB200仅127个,差距近一倍;batch size为8时,TPU达865个,GB200为636个。在Qwen上差距更大:4块TPU v7跑Qwen 3.8 27B,每秒1515个token,同配置GB200仅695个。提速未造成精度损失,greedy decoding验证下,Kimi K3在TPU上的GPQA-Diamond得分94.4%、GSM8K为97.2%,与GPU结果完全一致。

谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架

这一差距无法从硬件规格解释:TPU v7的HBM带宽为7380 GB/s,GB200反而更高,达8000 GB/s。差距实际来源于芯片上运行的软件。

大模型推理瓶颈不在计算,在数据搬运。每生成一个token,全部权重都要从HBM搬入芯片内部高速缓存算一遍。传统做法将一次推理拆成几百个独立kernel排队执行,交接间隙内存带宽空转。CUDA Graphs和英伟达PDL能缩短间隙,但kernel边界仍在。megakernel直接消除边界:Kimi K3共92层MoE计算,Inferact将其从头到尾塞进一个Pallas程序,一次调用走完整个前向传播。边界消失后,跨层权重预取顺理成章——第N层还在算MoE时,第N+1层attention权重已开始搬运,计算与搬运同时进行。

谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架

TPU硬件特性让这种编排更顺畅:每个TensorCore带64 MiB VMEM片上内存,生命周期完全交给软件管理,容量足够同时装下当前层计算数据和下一层预取权重。GPU方面,Blackwell架构片上内存分散在152个SM中,总量约38 MiB,由硬件自动调度,跨层编排限制更多。

Inferact用Pallas语言手写整个megakernel。TPU默认编译工具链XLA擅长优化单层计算,但跨92层协调数据搬运决策分支太多,找不到最优解。绕过XLA后,编译耗时从30分钟以上降至不到90秒。目前megakernel针对Kimi K3定制,换模型架构需重新适配,团队接下来将扩展支持更多模型架构。

Inferact去年11月成立,团队几乎就是vLLM原始开发者。CEO Simon Mo是vLLM原始维护者,伯克利EECS毕业,曾在Anyscale工作;联合创始人Woosuk Kwon是vLLM项目发起人,伯克利计算机科学博士,导师Ion Stoica,其提出的PagedAttention算法至今仍是vLLM核心技术;首席科学家游凯超曾获清华大学特等奖学金,主导vLLM分布式推理功能开发。a16z和Lightspeed领投,真格、红杉、Altimeter跟投。

此次TPU megakernel来自Inferact与Google Cloud的联合工程合作,目标是让TPU成为vLLM一流支持对象,所有优化成果回馈上游开源社区,tpu-megakernels代码仓库是首个公开成果。

标签: AI 资讯 AI

更多推荐阅读

模型不够强,灵巧手才要卷性能?源升智能杨思成谈机器人操作

模型不够强,灵巧手才要卷性能?源升智能杨思成谈机器人操作

灵巧操作的最高境界,是“无剑胜有剑”。在源升智能创始人杨思成看来,灵巧手之于机器人操作能力,就像兵刃之于剑术,模型越强,就越不依赖末端执行工具;反之,模型能力不够强时,就需要灵巧手加持才能更好完成任务。 杨思成在清华时期便专门研究灵巧操作,2018年加入腾讯Robotics X实验室,担任灵巧手项目总负责人。2024年,他成立源升智能,开启灵巧手创业。他认为,现在行业都在打造“神兵利器”——更多...

2026-09-27
中国最强AI芯片发布,平头哥再开源软件栈

中国最强AI芯片发布,平头哥再开源软件栈

9月22日云栖大会上,阿里巴巴CEO吴泳铭介绍新一代真武V900,称其是目前中国算力性能最强的AI芯片,性能达M890的3倍。但客户换用真武,还需确认原有代码、工具和开发经验能否迁移。芯片之外,软件生态同样决定客户选择。 9月23日,平头哥公布AI软件栈T-Head SAIL最新开源进展,扩大框架适配、加速库、工具链和通信库等开放范围。平头哥将AI芯片比作发动机,软件栈则是“变速箱+传动系统+驾...

2026-09-27
华为大模型双子星创业,要做物理世界的Scaling Law

华为大模型双子星创业,要做物理世界的Scaling Law

数亿元资金,投向了一场物理世界的基模实验。Physical AI创业公司息壤开物宣布,已连续完成数亿元种子轮及天使轮融资,由敦鸿资产领投,华控基金、三花控股、银杏谷资本、泽然资本、本坚基金、天使基石、标朴投资等跟投,估值达5亿美金。 公司创始人、CEO李寅,前华为云大模型CTO,华为大模型0-1阶段核心成员;联合创始人张含望教授,前华为多模态首席科学家。二人联手,瞄准具身智能尚未解决的底层难题:...

2026-09-27
前OpenAI研究员:Jev出现前AI世界是悲剧

前OpenAI研究员:Jev出现前AI世界是悲剧

“它会逐渐退到软件背景中,像数据库、正则表达式或其他基础设施一样,成为开发者随手调用的普通能力。”这是 TypeSafe CEO、Jev 创始人 Diogo Almeida 对 AI 的设想:当智能真正融入软件,用户甚至不必意识到它的存在。但怎样才能让开发者放心地把判断交给 AI,而不用守在旁边反复检查? 几个月前,在 AI Engineer 大会的演讲中,这位曾参与 OpenAI Instru...

2026-09-27
Opus 5.5与GPT-6被指偷师中国AI团队

Opus 5.5与GPT-6被指偷师中国AI团队

所谓“天下文章一大抄”。刚发布的Opus 5.5和GPT-6 Luna,身上满是姚顺雨和梁文锋的影子。两家公司预训练已做到极致,为提升智能、降低算力成本,都选择开辟新战场:Opus 5.5对上下文动手,GPT-6 Luna对缓存动手。 **阿莫迪偷师姚顺雨** 在Artificial Analysis智能指数中,Claude Opus 5.5在max档位下平均每题输出11.9万token,其中...

2026-09-27
OpenAI Codex负责人揭秘:从内部工具到顶流,终极目标不只是写代码

OpenAI Codex负责人揭秘:从内部工具到顶流,终极目标不只是写代码

过去两年,AI编程最明显的变化,不是“代码写得更快”,而是软件开发本身正在被重新定义。从只能补全几行代码的Copilot,到今天能读懂代码库、调用工具、执行测试、提交修改,甚至持续运行数小时乃至数天的Coding Agent,模型正从“辅助工程师写代码”进入软件工程的完整生命周期。真正变化的已不只是效率,而是人和代码之间的关系:当正确性检查、安全审查、依赖升级、重构乃至部分架构工作逐渐自动化,人类...

2026-09-27
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部