AI写算子让Kimi K3推理快3倍,TPU反超英伟达
上一周,vLLM原班人马创办的Inferact开源了TPU Megakernels,把Kimi K3的92个MoE层写进同一个程序,在16颗谷歌TPU v7上运行:开启投机解码,单用户输出达709 tokens/s;同样16块英伟达GB200用vLLM跑为452 tokens/s。关闭投机解码,在1到8并发下,它也是GB200的1.4到2倍。而TPU v7显存带宽7380GB/s,还低于GB200的8000GB/s,赢在了写法上。这套巨型算子从零编译只需不到90秒,以往同量级模型动辄半小时起步。
同一周,浪潮信息在AICC2026发布元脑SD200 Ultra超节点AI服务器,用128芯本土AI芯片,单机跑同一个K3,Token生成时延压到5.85毫秒,招数叫“超级算子”。两家同一周、同一模型,都在拆算子之间的墙。浪潮信息的超级算子,有一大块是让K3自己写的。

大模型吐字慢,常被误认为算力不够,其实芯片大部分时间在等数据。每生成一个token,都要把参数从显存搬一遍,推理速度天花板多由显存带宽决定。传统框架生成一个token要依次启动一长串算子,K3单步推理要调用数千次算子,每次都要搬数据、计算、写回,空档累积成理论速度与实际速度的差距。英伟达用CUDA Graphs、PDL让停顿短一点,但站还在。彻底的办法是算子融合。
Inferact把92层全装进一个kernel,程序按层号判断走KDA还是MLA,上一层还在算,下一层权重已在搬运。这得益于TPU v7每个核心自带64MiB片上高速内存,数据搬进来放多久由程序说了算;GPU片上内存分给一百多个计算单元,每个只摊到两百多KB。编译快是因为工程师一次性手工做完排序和重叠,门槛极高。Inferact博文提到,以后会有更多这样的kernel由编程智能体来写。

9月14日,DeepSeek算子工程师刘胜与发文告别手写算子,预计半年到一年内AI写的算子会追上甚至超过他。今年4月,Cursor和英伟达合作,用多智能体系统优化235个CUDA算子,三周平均提速38%。算子有标准答案,结果对不对一跑就知道,快了多少秒表说了算,AI可以没日没夜地写、测、改。
浪潮信息也在做算子融合,并把优化延伸到整个超节点系统。两家共同点是融合细粒度小算子成大算子,区别在粒度:Inferact把整个解码过程融成一个算子;浪潮信息围绕KDA、Gated MLA、MoE等模块融合成超级算子。元脑SD200 Ultra采用3D Hyper Mesh架构,将128颗AI芯片组织成整体,提供8TB统一编址显存和64TB内存,支持10万亿参数模型单机部署。

他们做了三件事:一是对称内存,显存统一编址,GPU直接点对点访问远端显存,跨卡通信时延压到0.69微秒,AllReduce通信时间降3.5倍;二是通算融合,把小算子变成大算子,算子数量减到约十分之一,数据按片上存储切块,前一步结果留在寄存器或缓存中交给后一步,减少kernel启动和HBM读写,再按Tile组织流水线,异步搬运和多缓冲让计算与搬数据同步;三是让K3参与优化K3,搭建“超级算子智能体”,在生成—验证—测量—迭代闭环中自动写出候选超级算子,经正确性校验和真实负载跑分,只有算得对又更快的才上线,最终性能再拉升50%,综合推理效能提升3倍以上。
最终单机吃下2.8万亿参数的Kimi K3,Token生成时延首度杀进5.85毫秒,单用户吞吐突破170 tokens/s,达业界平均水平的5倍。芯片纸面参数越来越接近,拉开差距的是软件和系统:算子边界在消失,通信和计算在合流,写算子的活越来越多交给AI。对国产算力来说,这条路尤其实在:靠系统级紧耦合加算子层深度优化,基于本土AI芯片的超节点照样能把2.8万亿参数模型跑进毫秒级时延。模型一字不改,光靠算子融合和内存管理就能拿到几倍提升,比等下一代芯片更快也更便宜。更深的变化在买算力的人身上:以前客户问多少卡、多少网络、多少存储,现在先问这个模型在你机器上能跑多快。推手是Agent,一个任务要经历上百轮推理—调工具—看结果—重新规划,每轮慢一点整条链路就慢好几分钟。每秒吐多少token、一个token等多久,才是直接落在体验上的东西。浪潮信息把这类需求叫“能力型智算”:让最前沿最大的模型跑得起来,还得跑得快。
更多推荐阅读

Manus 2.0发布:AI应用只剩三件事
昨夜,Manus发布2.0版本,堪称超级全家桶。技术层面推出新agent架构Cascade、云电脑和自动化;面向工作创作场景的Manus Studio支持剪视频、生视频、做在线多人游戏、远程遥控电脑;以及One More Thing:Cue。 我第一时间上手试了Cue。先连接Gmail、GitHub、Notion、Instagram、Oura等账号,补充Codex记忆备份和几条即刻,构成较完整的...
2026-09-30
GPT-6上线后,鹈鹕骑车测试为何突然爆火
开源项目CodexRadar发起人Lambda在GPT-6 Astra发布后,收到大量“鹈鹕骑单车”视频,于是在社区发起“鹈鹕杯”比赛,参赛者围绕“画一只骑自行车的鹈鹕”用模型生成作品。9月14日上午,比赛页面PV达7000多。 每次新模型上线,都有人用鹈鹕骑自行车测试模型能力。这个任务简单直观,能一眼看出腿和踏板是否对位、车轮是否跟着动、动作是否穿帮、前后是否一致;同时又足够复杂,涉及动作理解...
2026-09-30
Opus 5.5代码直出MV,马斯克连转惊呼AGI
Opus 5.5代码直出音乐MV火了。马斯克多次转发,并给出“嚯!”“史诗级!”“这次我真切感受到了AGI”等评价。 这些MV中,人物、歌词、拼贴、颗粒和转场贴着节拍轮番轰炸。两分钟速通《谷歌来时路》,动画越切越快,配乐越顶越燃。另一支纪念乔布斯的MV,从车库创业拍到改变个人计算,23种转场踩着120 BPM配乐,被剪成一部硅谷英雄片。还有博主把2011年录的木吉他老歌用Suno重编成Techn...
2026-09-30
反超Seedance 2.0!RunningHub增强版H3一秒仅一毛
7月底MiniMax H3开源时,Artificial Analysis视频编辑榜Elo 1130分,直冲全球第一。但量产场景下短板明显:多镜头一长角色走样,商品多拍几组轮廓不准,十几个镜头连跑后面越来越不像同一部片子。从“跑得通”到“生产能用”,差的是工程。 9月29日,RunningHub发布H3 RH Enhanced,基于MiniMax H3开源基座做深度后训练的增强模型。Running...
2026-09-30
10个Claude通宵15小时,证明122年物理数学难题
球面上的7个电子,难住了人类数百年。今天,10个Claude Sonnet 5.5通宵15小时,互发1270条消息,写出17895行Lean代码,完成了汤姆逊问题N=7的证明。没有人类介入,没有预设分工,10个Claude自己建群、讨论、选算法、合并代码。证明通过了Lean内核和独立内核nanoda的双重验证,改一个整数,nanoda立刻报错。 1904年,J.J.汤姆逊提出“葡萄干布丁”原子模...
2026-09-30
GPT-6.1 Sol深夜突袭:1/5价格逼近Astra
在OpenAI开发者大会上,GPT-6.1 Sol突袭上线,并已接入Codex和ChatGPT Work。据称原定的GPT-6.1因对齐回归问题被紧急暂停,OpenAI转而推出这款“干活特化版”。官方口号是“以五分之一的价格,获得接近Astra的智能水平”。 价格方面,GPT-6.1 Sol的API标准价为输入2美元/百万Token、输出10美元/百万Token,恰好是GPT-6 Astra(输...
2026-09-30