AI算力不靠堆卡,浪潮信息如何破局?
AI算力的竞争,多年来就一个字——堆。堆卡、堆机柜、堆发电机,似乎计算卡足够多、集群足够大,就能站在食物链顶端。但算力「够不够用」已不再能单靠堆卡解决,它开始分化出越来越多的层面。
第一个问题关于智能上限,即算力能撑起多强的智能。前沿模型的参数规模、上下文长度、推理深度同时变大,Agent可能连续运行几小时甚至几天。模型装不装得下、跑得快不快、长时间稳不稳,都需重新考量。另一个问题是智能规模——算力能以多低成本生产多少智能?Token需求爆发,推理负载多元,Prefill和Decode计算特征不同,堆同一种算力已覆盖不了差异。两个问题各自独立又相互关联,只解决一个无法突破全部瓶颈。
AICC 2026上,IDC发布《2026年中国人工智能计算力发展评估报告》,把这两个方向拆开讲了一遍。

Agent大爆发后,AI对算力需求正发生质变。过去算力调用像「脉冲式」,一问一答只调用一次。Agent接管任务后,一个人类意图可能触发几十次、几百次连续推理;多Agent协作网络让系统连续运转时长增至几小时甚至几天。原本短暂的算力请求变成持续计算负载,给基础设施带来新压力。
这种长流压力可拆解出三个影响因子:任务执行次数,IDC报告显示到2030年全球每年AI推理任务将增长4000万亿次;单任务Token消耗量,过去简单问答只消耗几十个Token,现在多轮任务决策要消耗几十万个;多智能体协同的「放大系数」,一个用户操作被拆解成多条Agent指令,Agent间传递上下文、汇总结果拉长任务链路,进一步放大前两项增长。三个因子以乘法叠加,将算力需求增长曲线拉到前所未有的高位。IDC数据显示,今年到2030年全球Token消耗量复合增长率将达4822.6%。
但算力供给增长速度滞后于需求变化。IDC报告显示,全球AI算力需求满足率从2024年的79%一路下滑,2027年预计跌至71%,即便此后上游半导体供应链压力缓解,到2030年也只能恢复到77%左右。到2030年,算力缺口绝对值将达3809亿美元,扩大到2024年的近十倍。

过去弥补缺口主要靠「大力出奇迹」,即通过集群规模扩展堆叠更多算力。但Agent时代推理负载种类繁多,对算力设施要求不尽相同。Prefill阶段是高并行、高计算密度任务,Decode阶段逐Token串行处理、更吃内存带宽,Attention需频繁访问不断增长的KV Cache,MoE包含稀疏计算和大规模路由调度,多模态模型还有独立Encoder模块。这些负载各有计算特征,还会随上下文长度、输出长度和并发规模动态变化。Agent任务中,首轮对话上下文可能只有一两万Token,经上百轮对话后扩展到三四十万,系统瓶颈在计算、显存、带宽和通信间不断转移。单纯堆料非但带不来线性容量增长,反而造成资源配比失衡,一部分算力长期闲置,另一部分持续过载。
实际上,缺口包含两个方向:一是能力上限,前沿模型参数规模、上下文长度、推理深度同时变大,一台机器装不装得下、跑不跑得快、长时间能不能跑稳,三个问题同时压来;二是产能,Token需求爆发,但负载类型各异,不同推理阶段需要不同特征算力,靠一种算力一招鲜吃遍天的路数已走不通。
浪潮信息首席AI战略官刘军把这两个方向概括为Capability和Capacity。Capability AI Compute是能力型智算,支撑前沿模型去碰过去碰不了的问题。如今AI已能从靶点出发发现新药物分子、完成筛选设计并推进临床试验,能求解困扰学术界几十年的NS方程和孪生素数猜想,能自主设计AI芯片并不断迭代性能。这些任务共同特征是推理链条长、模型规模大、对算力系统承载能力和稳定性要求极高。Capacity AI Compute是容量型智算,让智能供给更充足也更便宜,让更多人和企业用得起。

面对这两层问题,浪潮信息在AICC2026上发布两款产品——超节点AI服务器「元脑SD200 Ultra」和多元算力机组「元脑HC2000」。
SD200 Ultra解决前沿模型装不下、跑不快、跑不稳的问题。「装得下」是从0到1的一步,它延续去年SD200的3D Hyper Mesh架构,整机内芯片数量从64颗增至128颗,显存和扩展存储提升到8TB和64TB。目前全球最大开源模型Kimi K3有2.8万亿参数,SD200 Ultra可单机装下并高效运行,还支持单机部署10万亿参数模型。
128颗芯片协同工作,跨芯片数据交换每秒高达数十万次,传统方式依赖软件调用和缓冲区中转,延迟开销大。SD200 Ultra分两层解决:第一层「统一寻址」,通过全局统一编址、虚拟影子设备注册和跨域地址翻译,让128颗芯片显存形成统一地址空间,远端资源访问从消息通信加数据搬移变成地址空间内直接访问;第二层「对称直连」,通过对称内存技术实现GPU显存直连,GPU可像访问本地显存一样直接读写远端GPU显存,由GPU发起通信,跳过地址转换和封包中转,通信路径大幅缩短。最终All to All通信时延缩短到0.69微秒,达国际主流超节点产品相当水平。
计算也需优化。以
更多推荐阅读

ICLR 2027投稿量突破6万,超过历年总和
今年 ICLR 的摘要提交量达到 6 万+,已超过 ICLR 从 2013 年到 2026 年历年投稿总和。第一届 ICLR 收到 67 篇投稿,ICLR 2026 涨到 19525 篇,2013 至 2026 年十四届会议全部加起来约 5.6 万篇。如今一届 ICLR 2027 就超过了这个数字。 有网友算了一笔账:即使按 20% 录用率,6 万篇也对应 1.2 万篇论文。上一届 ICLR 2...
2026-09-22
清华教授押注机器人ICL:我看到了Scaling Law的信号
本周「十字路口」嘉宾是清华叉院助理教授徐梦迪。她本科读清华车辆工程,后赴Johns Hopkins、CMU,再到Stanford吴佳俊、李飞飞组做博士后,2024年初回国加入清华交叉信息研究院。她的核心命题是机器人的In-Context Learning:让机器人到新环境后,通过一两次交互当场学会新任务,且越学越快。 节目录完第二周,Generalist发布GEN-1.5,只给机器人看3-12秒...
2026-09-22
多模型分工省额度,还能接入JEV玩红警
上周文章提到 WebCodex 可把网页版额度用起来,随后有读者问:能否让不同模型干不同的活?这其实也是我的需求。主力工具是 Codex,但也买了别家 API,套餐余额分散,Codex 额度仍不够用。此前介绍的 Codex++ 虽能接入第三方模型,但一个任务只能用一个模型。我真正想要的是:把所有模型 API 接到一起,收到任务后先让高智商模型判断难度,再结合各模型能力和余额,把任务拆给不同助手。难...
2026-09-22
实测Qwen3.8-Omni-Flash:全模态Agent价格暴降90%
Qwen推出全模态模型Qwen3.8-Omni-Flash,在WildClawBench-MM等30项评测中平均得分比上一代Qwen3.5-Omni-Plus高出26%,音频能力整体超越Gemini 3.8 Flash,音视频能力接近Gemini。API价格大幅下降:相比上一代,每小时音频输入价格下降超98%,每小时音视频联合输入价格下降超93%。现价为每百万Token输入0.8元、输出2.7元,...
2026-09-22
腾讯混元招募外部专家共建AI大模型
腾讯推出面向外部行业人才的专家平台“混元智囊团”,Slogan为“聚智为谋,引领未来”。该平台隶属于腾讯混元旗下,通过连接各领域顶尖实战专家与真实AI训练问题,以高质量数据集生产、专业内容编写、知识审核为核心工作,产出的专家资源与专业数据服务于混元大模型持续迭代优化。 简言之,腾讯混元通过接单付费的任务模式,招募金融、法律、医疗、前端设计美学、代码等各领域专业人才,帮忙优化混元大模型能力,为AI...
2026-09-22
马斯克交卷Grok 4.7,这次吹牛吹大了
AI 圈没有假期。从 OpenAI、Anthropic 到 xAI,各家巨头集中抢位。SpaceXAI 正式发布 Grok 4.7,官方定位为目前最强的编程与知识工作模型,已进入 Cursor、Grok Build 和 Grok API,也将通过第三方编程工具、模型路由平台与云服务提供。发布比马斯克最初预告晚了不少,从 7 月下旬开始吹风,一再推迟。 Grok 4.7 使用比 Grok 4.6 ...
2026-09-22