单机跑Kimi K3仅5.85毫秒,浪潮信息破解Agent算力难题

单机跑Kimi K3仅5.85毫秒,浪潮信息破解Agent算力难题

AI 资讯 来源:新闻/公众号 发布时间:2026-09-23 更新于 2026-09-23 预计阅读 6 分钟

2026年,Agent火爆空前。IDC在AICC 2026大会上发布数据:2026年全球活跃Agent约7940万个,2030年将达22.16亿个;Token消耗量从0.026Peta增长到152667Peta。Agent数量增长约28倍,Token消耗增长数百万倍。

需求侧增长如此之快,算力供给能接住吗?今年两个案例十分典型:Kimi K3总参数量2.8万亿,权重文件1.56TB,普通AI服务器显存连权重都装不下,官方推荐至少64卡甚至更大规模才能运行,指向“向上”的困境——能力上限越高,部署门槛越从单机走向集群。DeepSeek上半年将V4-Pro的API价格下调75%,8月又预告整体提价,理由直指“算力不足”,指向“向广”的困境——性价比算力需求被迅速放大,容量不够,低价供给难以持续。

单机跑Kimi K3首破5.85毫秒,同等投资Token产能提升10倍!浪潮信息破局Agent算力难题

在AICC 2026大会上,浪潮信息给出回答:向上,Capability AI Compute;向广,Capacity AI Compute。会上正式发布元脑SD200 Ultra超节点AI服务器和元脑HC2000多元算力机组,通过系统协同,从提供算力走向生产智能。

超节点突破智能上限。Agent时代,一次用户意图背后可能是几十次、几百次甚至更多次推理,是多个Agent连续几小时甚至几天的协同工作。前沿模型Scaling up加速,Kimi K3参数量达2.8万亿,未来可能扩展到十万亿参数量级。简单堆服务器行不通,超节点的意义在于突破传统单机计算边界。元脑SD200 Ultra以开放系统设计紧耦合128芯本土AI芯片,实现统一内存寻址超低延迟通信,并以对称直连、算子优化等创新技术减少数据搬移与等待。基于这套系统,SD200 Ultra可单机运行2.8万亿参数的Kimi K3,Token生成时延首次突破5.85毫秒,还支持10万亿参数规模的前沿模型。其采用3D HyperMesh架构,提供8TB带宽和64TB内存;原生内存语义通信把跨芯片通信时延降低到0.69微秒;超级算子库体系将算子数量降低为原先的1/11,减少Kernel Launch次数和HBM访问开销,隐藏通信延迟。

单机跑Kimi K3首破5.85毫秒,同等投资Token产能提升10倍!浪潮信息破局Agent算力难题

让智能供给“供得上、供得便宜”。随着Agent数量和使用深度增加,Token需求继续快速增长,提高单位计算资源Token产出成为规模化供给关键。推理不是单一计算模式,Prefill和Decode计算特征不同,Attention和MoE对计算与访存要求不同,简单堆服务器不能带来线性能力增长。浪潮信息的答案是元脑HC2000多元算力机组,面向持续、大规模推理需求,基于DirectCom 2.0极速架构,以原生液冷高密整机柜为载体,按负载组织计算资源,实现多元算力协同。核心软件栈MCIS持续测量不同算力资源的能力与负载,根据任务需求动态分配算力并实时调整。硬件层面,HC2000采用全液冷设计和高通流供电,单柜供电能力达300千瓦以上,最大承载256张AI卡,算力密度实现4倍跃升。在国产算力基础上,通过MCIS和某模型适配,在典型Agent任务场景中,同等SLO约束下,相比单一算力构建的推理系统,实现同等投资10倍Token产能提升。

从Capability到Capacity,为什么需要系统协同?SD200 Ultra和HC2000,一个向上,一个向广,底层是同一个判断:当智能开始被“生产”,算力产业竞争不再是单点竞争,而是系统竞争。浪潮信息首席AI战略官刘军将这种思路概括为“贯穿式创新”:一是从芯片、服务器系统到模型的贯穿;二是从单机到系统的贯穿,根据不同计算负载特征匹配最适合的计算资源,如Prefill用大算力芯片搭配LPDDR颗粒,Decode选择大容量HBM芯片,FFN环节选择3D DRAM堆叠芯片,构建多元芯片、多元算力系统;三是从技术到生态的贯穿,产业协作从零和博弈转向开放共赢。

单机跑Kimi K3首破5.85毫秒,同等投资Token产能提升10倍!浪潮信息破局Agent算力难题

从更长周期看,Capability和Capacity并非两条平行线,而是一个循环。Capability负责创造新的可能,Capacity负责让新的可能被更多人获得。更大规模的智能普及,又会带来新的应用、新的数据、新的需求,推动下一轮Capability突破。系统协同,正是让这个循环持续运转的底层机制。

进入Agent时代,Token工厂不能只问拥有多少GPU、CPU,还应问:这些算力能够支撑多强的智能?能够以多低的成本生产多少智能?浪潮信息用SD200 Ultra向上突破智能上限,用HC2000向广推动智能规模化供给,连接两者的是系统级协同创新与开放生态。今天的Capability,正是明天Capacity需要规模化供给的能力。Agent时代,计算产业的使命因此变得比以往任何时候都更宽广。

标签: AI 资讯 AI

更多推荐阅读

平头哥真武V900发布:AI算力从单卡走向千卡互联

平头哥真武V900发布:AI算力从单卡走向千卡互联

从真武 V900 到新一代磐久超节点服务器,平头哥八年来布局的 AI 芯片、CPU、scale up 互联、scale out 网络和存储芯片,开始被装进同一套算力系统。9 月 22 日 2026 杭州云栖大会上,平头哥被完整推到主论坛台前,副总裁高慧发表题为「Agentic 时代卓越算力基石」的演讲,发布从真武 V900 芯片到 ICN Switch 互联芯片、磐脉智能网卡、镇岳 SSD 主控、...

2026-09-23
陆川用AI五天复原明代大爆炸,阿里全模态模型兜底影视生产

陆川用AI五天复原明代大爆炸,阿里全模态模型兜底影视生产

不用搭景,不用等演员,导演陆川和团队用AI把一场400年前的明代灾难现场做了出来。宫廷、火药库,以及史料中烟云如黑灵芝的大爆炸,按传统影视工业做法往往需要数月时间和千万级投入,这次只用了5天。 人物的脸、皮肤、神态已相当逼真,爆炸的烟尘、碎片、火光也稳稳接住。过去光是一场爆炸戏就要耗费19天。陆川团队把史料文字翻译成现代视觉概念,前后做了约四轮提示词优化,再参考真实爆炸影像校准。阿里视频生成模型...

2026-09-23
OpenAI新模型24天攻克100+数学难题

OpenAI新模型24天攻克100+数学难题

数学界正被AI迅速逼近。OpenAI一篇重磅博文披露,一款8月28日才开始训练的内部新模型,已攻克100多道世界级数学难题,横跨数学大部分领域,其中包括困扰学界多年的“纳维–斯托克斯”千禧年难题。从开训到9月21日官宣仅24天,进化速度令OpenAI内部数学家都感到意外。 9月8日,OpenAI称该内部模型在88小时内攻克NS千禧年难题,给出NS方程存在性与光滑性问题的证明,并公开166页论文和...

2026-09-23
国产AI生图新高度:真假难辨,还能精修到商用

国产AI生图新高度:真假难辨,还能精修到商用

两张图都是AI生成的,来自商汤科技正式上线的SenseNova U1 Pro,目前可在商汤小浣熊平台使用,API已向企业客户开放。 实测在SenseNova Studio平台进行,模型支持2K起步、最高4K清晰度。第一轮测试将一张生活照重构为纸质风格,随后仅修改人物外套内的黑色圆领T恤为白色,要求严格限定在可见内搭区域。由于T恤、皮带、裤子均为黑色且有胸牌遮挡,边界易混淆,但U1 Pro精准拿捏...

2026-09-23
剪映发布全新AI创作能力:从专业剪辑到普通用户全面提效

剪映发布全新AI创作能力:从专业剪辑到普通用户全面提效

剪映在2026 AI新创作发布会上发布全新AI能力,覆盖PC专业版与App端,分别聚焦“提效”与“省心”。 PC专业版推出剪映Hub,一站式AI创作平台,将AI创作与多轨道剪辑连接,让脚本、素材与创作上下文在同一项目中延续,减少跨工具切换的断点与重复操作。剪映助手Agent介入专业创作流程,承担素材整理、粗剪、包装等工作,可根据创作目标规划任务、串联模型工具并自动运行,用户也可自定义工作流,沉淀...

2026-09-23
AI操控游戏新选择:Jev模型到底能做什么?

AI操控游戏新选择:Jev模型到底能做什么?

Jev 是 TypeSafe AI 推出的决策模型,创始人 Diogo Almeida 曾在 OpenAI 参与指令跟随与对话研究。TypeSafe 开发两年后发布该系统,官方称为 System One Models。其使用方式是把当前情况和问题输入,模型返回程序可直接使用的结果,本质上是分类模型,接口主要有三种类型。 在游戏场景中,可每一步询问它:当前血量、怪物和金币位置、出口位置,目标是拿金...

2026-09-23
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部