智谱GLM-5.3-FlashX上线:推理提速5倍

智谱GLM-5.3-FlashX上线:推理提速5倍

AI 资讯 来源:新闻/公众号 发布时间:2026-09-18 更新于 2026-09-18 预计阅读 3 分钟

智谱上线GLM-5.3-FlashX,推理速度最高200 tokens/s,较GLM-5.3-Flash提速5倍、提价2.5倍,API同步开放。其背后是在10万张国产芯片提供的推理算力基础上,进一步加大对Infra侧的投入与推理优化。

GLM-5.3-FlashX 上线:200 tokens/s

GLM的Infra由GLM构建。跑Flash的这套Infra由GLM-5.3驱动Agent构建,从模型适配到生产上线不到两周,端到端吞吐做到初始基线的3倍。构建过程中,人负责定目标、设边界、搭反馈环境及关键修改审核;测试、日志、Trace、微基准交给Agent,由其自查问题、改代码、跑实验,局部验证通过后再放回完整服务验收,完成“稠密反馈”。

GLM-5.3-FlashX 上线:200 tokens/s

案例一:KDA的CP路径出现精度偏差,长上下文下尤其明显。Agent顺着状态合并、更新过程排查,问题落在两处tl.dot上:输入是FP32,计算却默认用了TF32,误差逐步积累。两处均显式加上input_precision="tf32x3",修复已合入Flash Linear Attention上游。

GLM-5.3-FlashX 上线:200 tokens/s

案例二:同样workload下,Prefill加上传输后与单独Prefill的性能差距要求不超过5%,测试却跑出20%以上。Agent翻看Trace,发现KV Transfer的Python侧执行始终未能与DeepEP的dispatch/combine调用重叠。进一步排查发现,DeepEP v1.2.1的两处C++调用没有释放GIL,负责Mooncake Transfer的Python线程拿不到锁,传输任务迟迟交不出去。修改后,同样测试条件下性能差距降到1%以内。

案例三:KDA Decode沿V维度分块,同一组FP32归一化和门控计算被不同分块重复做了四遍。Agent将这些分块合到同一线程块里,提前批量计算,共享中间结果。并行度减少,重复计算去掉,算子性能提高到优化前的1.71倍。

标签: AI 资讯 AI

更多推荐阅读

机器人量产了,具身智能为何反而更难了?

机器人量产了,具身智能为何反而更难了?

机器人本体批量落地,行业要补的课反而更多了。本体数量上来了,具身智能看似离规模化越来越近,但理解世界、学习新任务、持续进化的能力,还无法随机器人一起批量复制。行业关注重点正从如何造出机器人,转向如何持续生产和迭代机器人的能力。 9月16日,在2026智能经济论坛上,百度集团执行副总裁沈抖判断:智能体能力边界快速打开,已能处理更长程任务并进入规模化部署。类比AI时代,今天可能只是灯泡发明后的第一个...

2026-09-18
50万份文档喂给AI,WPS如何闯入造船厂一线?

50万份文档喂给AI,WPS如何闯入造船厂一线?

企业AI下半场,拼的是数据和上下文。 一家船厂手里压着近50万份研发制造文档;一名船舶设计师从新手成长为专家,往往需要十年以上。2026年下半年,腾讯WorkBuddy、阿里千问办公、字节豆包工作几乎同时把企业级Agent推到台前,加上金山办公,国内AI办公“四强”格局基本成形。但企业级Agent的卡点不是模型不够聪明,而是能否读懂海量图纸、规范和老师傅脑中未写下的判断标准。 金山办公带着WP...

2026-09-18
Claude狂写80%代码,Anthropic的CI半年被撑爆25倍

Claude狂写80%代码,Anthropic的CI半年被撑爆25倍

Anthropic披露内部数据:全公司80%的代码由Claude编写,工程师人均每季度交付代码量达2021—2025年平均水平的8倍。Claude还承担大量PR审查与合并批准工作。写代码、审代码不再是瓶颈,但CI系统在半年内被压垮:测试用例激增10倍,CI任务量暴涨25倍。 根本原因在于AI与人类研发行为模式的差异。人类提交PR数量有限、倾向打包改动,且需要休息,CI有低谷期消化任务。而Clau...

2026-09-18
字节AI教育出海记:豆包爱学如何让孩子少走弯路

字节AI教育出海记:豆包爱学如何让孩子少走弯路

过去两年,AI落地场景中,教育是增长最快、渗透超预期的赛道之一。字节跳动的Gauth自2020年推出以来,下载量超2亿次,成为现象级AI教育产品。字节随后将这套AI辅导能力带回国内,做成“豆包爱学”,更贴近国内学生的学习内容和使用习惯,现已更新到2.0。7月初,该产品与唐国强合作推出《出师表》系列互动课;在Seedance 2.5发布时,豆包爱学也被作为官方典型落地案例展示。 豆包爱学独立APP...

2026-09-18
智谱AI智能体两周让10万卡集群吞吐暴涨200%

智谱AI智能体两周让10万卡集群吞吐暴涨200%

RSI的最小闭环已经出现。智谱创始人兼首席科学家唐杰在X平台发表长文,首次曝出智谱在递归自我改进(RSI)领域的最新成果:在超过10万卡国产芯片组成的集群上,由GLM-5.3驱动的Infra Agent参与搭建了支撑GLM-5.3 Flash研发的生产级推理服务,仅用不到两周就完成从模型适配到生产可用的进化,将端到端吞吐提升至初始基线的3倍。唐杰认为,虽然距离递归式自我改进还很遥远,但最小闭环已经...

2026-09-18
红杉领投Mecka AI,估值5亿美元

红杉领投Mecka AI,估值5亿美元

据两位知情人士透露,专注于收集和分析人体运动数据以训练人形机器人及其他机器人的初创公司Mecka AI,即将完成由红杉资本领投的新一轮融资,估值约为5亿美元。此次融资距离上一轮仅过去三个月,此前该公司宣布完成由Framework Ventures领投的6000万美元融资,参投方包括Menlo Ventures、SV Angel和Kindred Ventures。 Mecka AI由四位联合创始人...

2026-09-18
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部