国产GPU推理性能翻7倍,算力运营成新突破口

国产GPU推理性能翻7倍,算力运营成新突破口

AI 资讯 来源:新闻/公众号 发布时间:2026-09-25 更新于 2026-09-25 预计阅读 5 分钟

随着大模型算力需求攀升,GPU采购成本与供给约束加剧,AI推理竞争正从“买到顶级硬件”转向“把已有算力用得更值”。许多GPU卡虽能通过开源框架完成模型加载与服务拉起,但实际压测性能远低于官方水平,核心原因在于模型框架与硬件间的性能鸿沟。这类卡无高速卡间互联,也不在主流框架官方验证矩阵中,直接使用默认部署方案会导致算子回退、通信参数错配、显存与并行配置沿用他厂默认值,硬件潜力被软件适配短板禁锢。

PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐直接翻近7倍

是石科技(METASTONE)作为独立第三方全栈算力运营商,不绑定特定大模型厂商,提供硬件、组网、调度、优化与运营一站式服务。公司源自国家级计算中心经验,保障集群99.95%以上SLA,已纳管超20000P算力,运营10多个智算中心,拥有2个国家级超算中心,团队曾获3项戈登·贝尔奖。其自研Meta-Infer高效部署引擎,面向异构加速芯片,通过纯软件优化弥合硬件与框架缝隙,不改模型结构、不改任务语义,挖掘GPU推理能力,让低成本GPU在部分指标上逼近高端GPU。

PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐直接翻近7倍

Meta-Infer优化分两阶段:算模协同释放被硬件差异屏蔽的高性能路径;通算重构打通瓶颈。最终沉淀四项核心能力:内核补齐、算子优化与通信重构、并行与容量调优、缓存复用。

PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐直接翻近7倍

内核补齐针对长尾硬件:框架对未验证硬件不报错,只静默降级。Meta-Infer对齐元数据与页尺寸,解锁原生高性能算子;替换不适配内核;扩大通信快路径阈值。以DeepSeek-V4.1-Flash在8张PCIe-Only卡上为例,社区Day0基线输入吞吐1932 tok/s,修复后达5850 tok/s。该阶段在DeepSeek-V4-Flash、GLM5.3等模型上带来20%-33%吞吐增益。

完成适配后,瓶颈转向通信、并行、显存与重复计算。PCIe带宽远低于NVLink,套用高速互联默认策略会致GPU等待。算子优化与通信重构对注意力、投影等做融合,计算与通信重叠,改写集合通信适配PCIe。并行与容量调优放弃全局固化参数,针对Prefill/Decode差异化配置张量并行、上下文并行,动态调整显存与KV缓存,灵活匹配流水线组合。缓存复用面向长文本、视频生成,提供风险感知机制,动态判断复用与刷新时机。

DeepSeek-V4.1-Flash完成全套调优后,输入吞吐从5850升至13274 tok/s,整体提升6.87倍,支持1M上下文。方法论具通用性:DeepSeek-V4-Flash从14546升至22584 tok/s,提升1.55倍;GLM5.3从3236.78升至6222.72 tok/s,提升1.92倍,P95首Token时延从141.6秒降至46.6秒,上下文从27万拓展至105万Token。同并发下,B300输入吞吐约为该8卡整机的4.9–5.6倍(DeepSeek-V4-Flash),GLM-5.3为3.5–4.7倍。MiniMax H3视频生成模型经稀疏注意力、风险感知缓存复用、Turbo LoRA组合,15秒参考图生视频端到端提速2.48倍,峰值显存持平。单机8卡文生视频最高吞吐达基线5.33倍,参考图生视频4.98倍。统一整机口径下,文生视频296条/时、参考图生视频131条/时,分别约为B300的67%和58%。按整机吞吐折算,Ours Cache方案下约2.6台6000D对应1台B300文生视频,参考图生视频约2.9台;Ours Cache+LoRA下缩小至约1.5台和1.7台。硬件未变,差距缩小主要来自软件栈、缓存策略与模型优化组合。

国产GPU同样验证:需显式启用NSA稀疏注意力,关闭不适配的Shared Expert融合,通信按阶段配置DeepEP normal与low_latency,并将Shared Expert与Routed Expert拆分双stream并行提交,仅此一项在35组配对测试中带来11.26%吞吐提升。全部优化收敛于Meta-Infer内部,不改权重与结构,不改任务语义。对大量不在官方验证矩阵的长尾硬件,“能跑起来”不是终点,通过内核补齐、算子通信重构、并行容量调优、缓存复用,可充分挖掘现有PCIe架构硬件潜力,为推理业务提供新可能。

标签: AI 资讯 AI

更多推荐阅读

30多年PT展今年因AI大不同

30多年PT展今年因AI大不同

最近几天,北京国家会议中心门口排起长队。这是我第三次来中国国际信息通信展览会(PT展)。前两次来,展台上最常见的是基站设备、光纤模块、通信芯片,AI更多停留在屏幕里。今年非常不一样,AI落地的深度和广度都明显提升,能在具体场景、关键场合看到AI替谁干了什么活。 进馆后第一个注意到的反而不是AI,而是PT展的名字。过去三十多年,PT代表Post & Telecommunications,今年被重新...

2026-09-25
具身智能的数据困局:真机采集贵,世界模型能补上吗

具身智能的数据困局:真机采集贵,世界模型能补上吗

具身智能赛道长期受困于数据问题。真机采集昂贵耗时,规模化门槛高,物理交互样本转化为机器人能力仍有距离。国际上,Tesla Optimus依托工厂真机遥操积累万级episode数据;Figure AI与英伟达押注仿真合成与世界模型。国内头部企业纷纷自建数据工厂,从UMI手持采集到EgoCentric第一视角视频,扩大数据来源。 具身智能形成算力、数据、模型的三角关系,构成“数据飞轮”,但存在“鸡生...

2026-09-25
千问布局个人智能体,AI助手开始干实事

千问布局个人智能体,AI助手开始干实事

Meta新产品Muse接入邮件、日历等服务,能帮用户安排事务、处理琐碎工作,并记住聊天中交代的个人情况。用户说一句话,AI自行查找信息、调用工具。上线一周即登顶App Store。这说明美国用户都想拥有一个助理,中国市场前景更大。 中国市场一级市场炒作最狠的是齐俊元的Today.ai,已全员在即刻发通稿进军中国区;另外是千问,一直专注把各种工具和服务接进来。此前我认为千问APP堆一堆Agent功...

2026-09-25
CPU重回C位!鲲鹏造出4096节点超级计算机

CPU重回C位!鲲鹏造出4096节点超级计算机

2026年,CPU成了AI世界的「硬通货」。全球服务器CPU集体涨价、交货期拉长,最夸张时订货要等半年。原因很简单:AI不再只是对话机器,Agent智能体开始自己规划任务、调用工具、运行代码、管理记忆,这些活儿全得靠CPU来扛。CPU这个曾被GPU光芒掩盖的「老兵」,正在Agentic AI浪潮中重返算力舞台中央。 9月17日,第十一届华为全联接大会在上海开幕,3场主题演讲、20场峰会、60多场...

2026-09-25
中国物理RSI黑马三榜第一完胜GPT-6

中国物理RSI黑马三榜第一完胜GPT-6

早晨,机器人管家X1已站在餐桌旁,你没说话,它就把椅子轻轻拉开。你出门后,它转身拿起逗猫棒,几个回合就摸透了猫的脾气。晚上你推门回家,一句“我回来啦”还没落地,它已夹着拖鞋迎上来:“公主,请换鞋。”这就是个性化家庭服务——能适应你的习惯、理解你的家庭环境、量身定制服务的机器人管家。但逗猫手法、迎接仪式,每家每户都不一样,出厂预装不了,也穷举不完。最简单的办法是你亲自演示一遍,它就会。 为此,诺因...

2026-09-25
实测Opus 5.5:一句提示词生成100个网页,还能动画谱曲

实测Opus 5.5:一句提示词生成100个网页,还能动画谱曲

Opus 5.5 发布后,网友纷纷抢着试用,作品涵盖网页、动画、游戏等,比 benchmark 数值更直观。创作者 MiaAI Lab 让 Opus 5.5「做 100 个 HTML 文件」,要求好看、设计不重复、充分发挥创意,成品十分惊人,每个点开都像模像样,展现出模型对不同交互形式和视觉风格的多元化处理。从创意构思、任务拆解到成品制作,Opus 5.5 展现了很强的自主性。 这正好是 Ant...

2026-09-25
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部