智谱10万国产卡两周让GLM优化自身推理系统
两周时间,10万颗国产AI加速器,一个开始优化自己的模型。智谱GLM首席科学家唐杰在X平台分享了一项关于GLM-5.3-Flash推理系统优化的研究。他透露,从GLM-5.3-Flash首次运行在国产AI加速器上,到完成全部生产流量承载,仅用了两周时间,系统端到端吞吐能力提升了3.2倍。最让唐杰印象深刻的是,完成大量优化工作的并非只有基础设施工程师,还有一个由GLM-5.3驱动的Infra Agent。“一个帮助优化服务自身的模型。”唐杰这样描述这一变化。在他看来,这意味着AI开始参与优化承载自身运行的系统。虽然距离真正意义上的递归自我改进仍然很远,但一种早期形态已经出现。
智谱团队提到,过去一年里,他们观察到GLM的角色正在发生变化。最初,团队探索GLM在代码理解和网络安全领域的能力,希望让模型帮助分析复杂代码中的漏洞。但随着模型能力提升,GLM开始参与构建AI系统本身。团队表示,他们曾观察到模型完成一些过去需要资深基础设施工程师团队花费数周才能完成的任务,而这些工作又会直接影响下一代模型训练和部署方式。

将一个大模型从新硬件上的首次运行,推进到能够稳定承载生产请求的推理服务,需要大量系统工程工作。GLM-5.3-Flash此次部署运行在超过10万颗国产AI加速器组成的集群上。智谱团队表示,这是一次此前缺少成熟经验参考的大规模部署。团队需要解决多个问题,包括国产芯片显存容量和互联带宽限制、新模型架构适配、100万token长上下文支持,以及多模态请求处理等。与此同时,国产AI加速器的软件生态仍处于发展阶段,部分Kernel支持不足,很多资料也需要工程团队自行探索。唐杰表示,在这些限制条件下,GLM-5.3驱动的Infra Agent参与了推理系统优化过程,帮助分析性能瓶颈、提出优化方案,并完成部分代码修改。
整个优化过程并不是简单增加计算资源,而是在算力、内存、通信和调度之间寻找新的平衡。智谱团队采用了一系列优化方案。例如,通过ReplaySSM用计算换取内存空间,通过节点内张量并行降低显存压力,通过INT8、FP8、BF16混合精度缓存提高容量利用率,同时引入Encode-Prefill-Decode分离式架构,让不同推理阶段能够更加灵活地调度。最终,GLM-5.3-Flash的端到端服务性能相比初始版本提升约3倍,硬件利用率和单token成本达到接近主流NVIDIA GPU平台的水平。

部署完成后,GLM-5.3-Flash还进入真实使用环境测试。智谱团队介绍,该模型曾以匿名模型名Ox-Alpha运行在OpenCode和OpenRouter平台,一周内成为两个平台使用量最高的模型之一,六天处理超过62万亿token。
不过,这次实验真正的变化,并不只是让AI写代码,而是让AI能够理解复杂系统为什么出现性能变化。例如,当系统反馈“吞吐下降20%”时,它只能说明某个地方出现异常,却无法直接告诉Agent哪一层出了问题,当前假设是否错误,以及下一步应该验证什么。对于资深工程师来说,这类判断依赖长期经验。智谱团队希望把这种工程经验转化为AI可以调用的反馈机制,并将其称为“dense feedback”。这套机制的核心,是让Agent获得更加接近工程判断过程的信息。当模型需要确认计算是否正确时,它可以获得对应的正确性反馈;当模型需要分析性能下降原因时,它可以查看系统运行过程中的时间消耗;当模型尝试新的优化方案时,它可以通过实验判断该方案是否适用于当前场景。智谱团队认为,真正有效的反馈需要满足几个条件,它必须足够接近具体问题,能够快速获得,同时能够通过客观实验验证。

在dense feedback的帮助下,Infra Agent开始参与定位推理系统中的隐藏问题。在KDA的上下文并行路径中,Agent发现了一个影响长上下文计算精度的问题。由于不同上下文分片之间需要不断合并状态矩阵,TF32计算产生的舍入误差会随着序列长度增加不断累积,最终导致计算结果偏差。Agent通过比较不同执行路径的结果,将问题定位到状态传播和合并过程中的精度处理。相关修复已经合并到Flash Linear Attention项目PR #1180。另一个问题出现在KV Transfer与DeepEP调度之间。测试过程中,Agent发现KV Transfer没有与DeepEP Dispatch形成有效重叠,导致部分场景下传输开销超过30%。随后,Agent沿着Python与C++调用链继续分析,发现节点内路径没有及时释放Python GIL,使传输任务无法及时推进。完成修改后,KV Transfer带来的额外开销从超过30%降低到1%以下。此外,Agent还优化了一个Decode Kernel。它发现,由于Kernel切分方式的问题,同一组归一化计算被重复执行四次。通过重新组织计算结构,减少重复计算,该Kernel最终获得1.71倍性能提升。这一优化思路来自Agent对SGLang、Flash Linear Attention和DeepGEMM等项目现有Kernel的学习。它将这些代码中的优化经验提炼成“optimization skeleton”,再结合当前系统反馈判断是否适用。
过去,类似优化经验主要依赖工程师个人积累。而在这一过程中,Agent开始能够从已有代码中学习优化方法,再通过实验验证这些方法是否适合新的硬件和模型环境。唐杰表示,人类工程师仍然负责设定目标、搭建反馈环境,以及审核高风险修改。但工程师的角色正在变化,从直接解决每一个问题的人,逐渐转向设计反馈系统的人。智谱团队认为,建立在真实基础设施任务上的可验证反馈环境,可能也是训练下一代模型的重要基础。每一次Agent完成
更多推荐阅读

Manus拆分后首轮融资33亿 估值翻倍至268亿
据彭博消息,Manus正计划完成约5亿美元融资,估值有望达40亿美元,较此前20亿美元估值翻倍。知情人士称交易已接近完成,但仍处早期阶段,条款和投资者名单可能变化。这是Manus从Meta分拆后的首笔融资,若谈成将成为中国通用AI智能体赛道估值最高的公司。现有投资方包括腾讯、HSG和真格基金,未来可能效仿月之暗面寻求赴港上市。 Manus于2025年初在武汉和海淀成立,做AI智能体产品,邀请码一...
2026-09-17
Gemini 4 Pro疑伪装现身盲测,2M上下文泄露
今天上午,有用户在Code Arena的battle模式中抽到标着gemini-3.8-flash的模型,让其用HTML画一只鹈鹕骑自行车的2D SVG动画。结果鹈鹕有完整踩踏动作,背景会切换场景,嘴里还叼着一条鱼。将“鹈鹕”换成“提壶”后,生成的开水壶精骑自行车同样惊艳:壶盖冒热气,车后座绑着茶叶包,炉火温度和踏频都做成了可调控件。而正常3.8 Flash跑同一提示词,只出来一只方块拼成的静态鸟...
2026-09-17
谷歌让AI“做梦”训练,破解自我改进算力难题
AI要学会自己改进自己,谷歌打算先让它做个“梦”。这场“梦”瞄准的是AI行业热议的RSI,即递归自我改进:让AI改进自身,改进后的系统再继续改进自己,一轮接一轮。但这个循环有一道坎:换一种做事方法究竟有没有用?如果每调整一次探索策略都要把整轮实验重跑一遍,AI变强的速度不好说,算力账单倒是先涨起来了。 谷歌研究团队在新论文《Dream-RSI》中给出思路:让AI先在“梦里”试。所谓“做梦”,就是...
2026-09-17
手机背面成AI硬件新战场,创业者扎堆涌入
录音卡、副屏、电子纸、AI 宠物……过去一年,AI 硬件创业者开始扎堆手机背面。 Plaud 的 AI 录音卡累计出货突破百万台。2026 年 6 月,Plaud 宣布 ARR 达到 1 亿美元、服务超过 200 万专业用户;截至 9 月,全球用户数已超过 250 万。做磁吸电子纸屏的阅星曈完成近 5000 万元 A 轮追加融资,顺为、经纬、博裕和小红书等老股东继续跟投;极稚科技称其无源墨水屏手...
2026-09-17
AI手机只会答题还不够,vivo想让它真正替你办事
AI能力更强,并不意味着手机用户体验更好。航班延误通知弹出后,AI能总结内容、回答晚点多久,但真要继续处理改签、酒店、会议等一连串任务,事情立刻复杂起来。它还未必记得你的习惯:愿不愿意坐凌晨航班、在不在意多花几百块、第二天会议能否迟到。想在手机上开发应用,还要考虑接口、MCP等问题。于是AI好像什么都会一点,但真遇到事,最后常还是得自己动手。 这解释了AI手机越来越明显的落差:模型能力上涨,Be...
2026-09-17
开口使唤AI干活,这款299元硬件真能让你当甲方?
想象一下,你正在赶PPT,突然想让AI把一张产品图改成海报。过去需要打开AI窗口、输入提示词、上传素材,再把结果复制回设计软件。现在有人想把这一整套操作压缩成一个动作:开口说话。为此,他们做了一款硬件——Vibe Key AI键盘麦,由优篮子Ulanzi与腾讯WorkBuddy联合推出,售价269至299元。它看起来像一个麦克风、三颗按键加一颗旋钮,更像给AI配的“指挥棒”:按一下,说句话,就能调...
2026-09-17