智谱AI智能体两周让10万卡集群吞吐暴涨200%

智谱AI智能体两周让10万卡集群吞吐暴涨200%

AI 资讯 来源:新闻/公众号 发布时间:2026-09-18 更新于 2026-09-18 预计阅读 5 分钟

RSI的最小闭环已经出现。智谱创始人兼首席科学家唐杰在X平台发表长文,首次曝出智谱在递归自我改进(RSI)领域的最新成果:在超过10万卡国产芯片组成的集群上,由GLM-5.3驱动的Infra Agent参与搭建了支撑GLM-5.3 Flash研发的生产级推理服务,仅用不到两周就完成从模型适配到生产可用的进化,将端到端吞吐提升至初始基线的3倍。唐杰认为,虽然距离递归式自我改进还很遥远,但最小闭环已经存在:模型优化系统,系统服务于模型。

智谱唐杰突发长文曝RSI进展:Agent优化10万卡集群吞吐暴涨200%,AI造AI还远吗?

RSI是AI自我进化的前沿探索,也是智谱未来研发的重要方向。9月13日,智谱宣布完成约50亿美元融资,约60%将用于下一代GLM基础模型和完全自训练体系研发,以及大规模训练、生产推理、算力资源和相关技术基础设施的部署与升级,最终逐步形成RSI。智谱认为,若这一趋势延续,给足算力与时间,终点是一个能够完全自主设计并训练出自己继任者的系统。同时,智谱去年已启动安全能力增强研究,合作伙伴用GLM在真实代码库中发现数千个漏洞,并设置受信访问计划,确保能力被负责任地使用。

智谱唐杰突发长文曝RSI进展:Agent优化10万卡集群吞吐暴涨200%,AI造AI还远吗?

GLM-5.3-Flash的上线经历了从让模型在新硬件上运行,到构建稳定承载生产流量的高性能推理服务的完整过程。此前没人成功部署过如此大规模的国产卡集群,面临芯片内存容量和带宽受限、需支持1M上下文窗口和多模态请求、生态不成熟、算子不完备等挑战。最终完成这项工作的不是一支团队,而是GLM-5.3驱动的Infra Agent。GLM-5.3-Flash以匿名模型Ox-Alpha在OpenCode与OpenRouter上接受真实调用检验,上线一周成为双平台调用量最大的模型,6天token调用量超过62万亿。

智谱唐杰突发长文曝RSI进展:Agent优化10万卡集群吞吐暴涨200%,AI造AI还远吗?

团队实施了一系列激进的内存优化,包括以算力换带宽、以通信换显存等定制化方案。技术栈融合了针对线性注意力和LM Head的节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合精度缓存量化,以及Layer Split等,并引入Encode–Prefill–Decode(EPD)分离式架构,实现端到端服务性能约3倍提升,硬件利用效率与单Token成本均达到主流NVIDIA GPU的相当水平。

智谱认识到,决定Infra Agent工程效果的不仅是模型自身的代码生成与推理能力,更取决于系统能否持续提供有效、可归因的反馈。代码库只能提供静态上下文,而推理系统中的精度异常、性能退化往往来自算子实现、并行策略、通信行为、内存管理与服务调度等多个层面的动态交互。端到端指标只能告诉Agent“结果变差了”,却无法解释“为什么变差”。因此需要将稀疏的端到端结果转化为细粒度、可归因且能直接指导下一步行动的工程反馈。

为此,智谱将正确性测试、运行日志、执行Trace、运行时事件、微基准测试和端到端指标纳入Agent迭代流程,把系统优化过程拆分为可局部观测和验证的环节,称为“稠密反馈”。其强调三个特征:反馈足够局部,能关联到具体引擎启动参数、代码、算子、输入条件等;反馈能低成本、及时获得,缩短验证周期;反馈支持客观验证,通过控制变量对照实验确认根因。局部验证用于尽早排除错误修改,端到端测试确认局部收益能否转化为真实服务收益。

GLM-5.3 Flash的上线过程形成了由工程师、Infra Agent和实验环境共同组成的优化闭环:工程师定义目标与系统边界,Agent负责分析、假设和修改,实验环境提供分层、及时且可验证的反馈。这一演进既包含直接推动吞吐增长的性能优化,也包含决定系统能否正确稳定上线的缺陷修复。例如,在算子验证过程中,团队发现了KDA算子上下文并行路径的精度问题,CP与非CP结果之间的偏差使检查重点落到并行执行引入的状态传播与合并计算上。

标签: AI 资讯 AI

更多推荐阅读

机器人量产了,具身智能为何反而更难了?

机器人量产了,具身智能为何反而更难了?

机器人本体批量落地,行业要补的课反而更多了。本体数量上来了,具身智能看似离规模化越来越近,但理解世界、学习新任务、持续进化的能力,还无法随机器人一起批量复制。行业关注重点正从如何造出机器人,转向如何持续生产和迭代机器人的能力。 9月16日,在2026智能经济论坛上,百度集团执行副总裁沈抖判断:智能体能力边界快速打开,已能处理更长程任务并进入规模化部署。类比AI时代,今天可能只是灯泡发明后的第一个...

2026-09-18
50万份文档喂给AI,WPS如何闯入造船厂一线?

50万份文档喂给AI,WPS如何闯入造船厂一线?

企业AI下半场,拼的是数据和上下文。 一家船厂手里压着近50万份研发制造文档;一名船舶设计师从新手成长为专家,往往需要十年以上。2026年下半年,腾讯WorkBuddy、阿里千问办公、字节豆包工作几乎同时把企业级Agent推到台前,加上金山办公,国内AI办公“四强”格局基本成形。但企业级Agent的卡点不是模型不够聪明,而是能否读懂海量图纸、规范和老师傅脑中未写下的判断标准。 金山办公带着WP...

2026-09-18
Claude狂写80%代码,Anthropic的CI半年被撑爆25倍

Claude狂写80%代码,Anthropic的CI半年被撑爆25倍

Anthropic披露内部数据:全公司80%的代码由Claude编写,工程师人均每季度交付代码量达2021—2025年平均水平的8倍。Claude还承担大量PR审查与合并批准工作。写代码、审代码不再是瓶颈,但CI系统在半年内被压垮:测试用例激增10倍,CI任务量暴涨25倍。 根本原因在于AI与人类研发行为模式的差异。人类提交PR数量有限、倾向打包改动,且需要休息,CI有低谷期消化任务。而Clau...

2026-09-18
字节AI教育出海记:豆包爱学如何让孩子少走弯路

字节AI教育出海记:豆包爱学如何让孩子少走弯路

过去两年,AI落地场景中,教育是增长最快、渗透超预期的赛道之一。字节跳动的Gauth自2020年推出以来,下载量超2亿次,成为现象级AI教育产品。字节随后将这套AI辅导能力带回国内,做成“豆包爱学”,更贴近国内学生的学习内容和使用习惯,现已更新到2.0。7月初,该产品与唐国强合作推出《出师表》系列互动课;在Seedance 2.5发布时,豆包爱学也被作为官方典型落地案例展示。 豆包爱学独立APP...

2026-09-18
红杉领投Mecka AI,估值5亿美元

红杉领投Mecka AI,估值5亿美元

据两位知情人士透露,专注于收集和分析人体运动数据以训练人形机器人及其他机器人的初创公司Mecka AI,即将完成由红杉资本领投的新一轮融资,估值约为5亿美元。此次融资距离上一轮仅过去三个月,此前该公司宣布完成由Framework Ventures领投的6000万美元融资,参投方包括Menlo Ventures、SV Angel和Kindred Ventures。 Mecka AI由四位联合创始人...

2026-09-18
豆包2.1 Pro实测:一句话生成3D山西旅行导览

豆包2.1 Pro实测:一句话生成3D山西旅行导览

国庆、中秋双节临近,字节跳动上线新版豆包2.1 Pro(版本号0915),API已在火山方舟全量上线,豆包工作同步接入。官方更新方向包括多模态Coding、Agent专业任务交付、面向3D与专业图文的多模态理解,以及Token效率,其中多模态编程最受关注——让模型看着设计稿、图纸、录屏写代码,再根据运行画面继续修改。 我们围绕该模型做了一轮实测。给它一段提示词,它交出了一份可交互的3D山西旅行导...

2026-09-18
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部