国产万卡算力爆发,科大讯飞让AI反哺算力
最近几个月,国产 AI 算力开始密集跨过新的数量级。7 月,全国产十万卡 AI 超集群落成;9 月初,无锡国产万卡级智算中心一期 2000 张摩尔线程 MTT S5000 GPU 智算卡全部投入运行,集群算力需求基本达到满载;国产卡正进一步向万卡乃至十万卡级训练基础设施迈进。
集群规模越来越大,新问题也随之而来:这些芯片究竟能发挥出多少实际训练能力?大模型训练中,卡数增加会推高系统复杂度。单芯片算子效率差异放到数万块芯片上会被放大;小规模训练中不明显的通信等待,在万卡集群会变得可观;节点增加、周期拉长后,软硬件故障也更频繁。因此,评价算力系统除了看芯片数量和单卡性能,还要看算子、通信、并行调度、故障恢复及软件栈能否配合。

9 月 7 日,科大讯飞发布星火 X2.5。该模型采用 MoE 架构,参数规模 293B-A30B,重点提升代码和智能体能力,覆盖 200 余种语言,在语言理解、答题、推理等通用任务上保持优异效果。其中,万卡规模国产 910B 集群承担预训练和后训练,线上推理基于国产平台,并配合多步投机解码提升效率。随着代码和工具调用能力增强,星火 X2.5 也开始参与 NPU 算子优化,AI 开始反过来参与底层算力优化。
通过这次真实大模型训练,可进一步探讨万卡国产算力面临的工程问题:算子效率、长上下文处理、万卡通信、长周期训练稳定性,以及模型与底层算力之间的反馈关系。科大讯飞技术人员将万卡训练核心挑战概括为:算得快、装得下、传得顺、跑得稳。

算得快方面,团队围绕国产关键算子定向优化,Attention 计算算子效率相比基础实现提升 2 倍以上。针对长序列训练,星火 X2.5 采用结合动态负载均衡的长序列并行方案,长文本训练效率相对提升 30% 以上。
装得下方面,星火 X2.5 引入稀疏注意力机制和跨层共享稀疏注意力索引,减少长上下文带来的计算和资源开销。

传得顺方面,星火 X2.5 在通用通信优化外,针对超长序列引入通信压缩、分层通信和计算并行等方式,相关训练效率提升 10%。
跑得稳方面,星火 X2.5 结合国产芯片全域异常检测能力,基于数十万训练任务问题分析,实现任务配置训前校验、训中卡死自动检测、失败任务自动重提、历史固定报错节点自动剔除,以及故障时进程级快速恢复和取消任务时临终 checkpoint 保存,机器有效训练时长超过 97%。
星火 X2.5 重点提升代码和智能体能力。训练阶段,模型围绕数学、编程、智能体工具调用和指令遵循等任务开展大规模强化学习,并训练不同领域教师模型,再通过多教师在线策略蒸馏,将多个教师模型优势整合到统一发布模型中。测试覆盖 Terminal Bench、SWE Pro、SWE Verified、SWE Multilingual、NL2Repo 和 SciCode 等任务,关注终端操作、真实代码仓库修改、多语言软件工程和科学编程等场景。实际演示中,模型可根据自然语言需求生成完整网页,也能结合视觉识别与角色反馈,完成手势互动 Web 应用。这些案例表明,代码能力和智能体能力正在合流:模型理解任务及约束,拆解复杂目标,调用工具执行代码,并根据错误或运行结果持续修正。
当这一闭环迁移到底层软件领域,模型处理的问题会从“代码能否正确运行”延伸到“在保证正确性前提下,代码能否在真实硬件上跑得更快、更高效”。算子优化正是代表。为此,科大讯飞在无监督训练阶段基于 GitCode 优质昇腾算子仓库,构建包含 CANN 编程规范和典型高性能实现模式的训练语料;后训练阶段围绕真实开发场景构建大规模、可验证的算子效率优化任务,让模型在真实 NPU 环境中开发设计、性能剖测和迭代优化。当前实践中,任务目标、初始代码、硬件环境和评估脚本仍需预先设置,模型作用是在这些条件下进行多轮工具调用和方案探索,提高部分算子开发与优化环节的自动化程度。
DSA 细粒度稀疏注意力算子是一个具体例子。DSA 面向长上下文场景,通过集中计算关键部分减少计算量,但稀疏计算也带来更零散的数据访问,数据搬运效率成为新影响因素。在仅提供基础版 Ascend C 实现、任务描述和评估脚本的情况下,星火 X2.5 在昇腾 910B 设备上进行多轮自主优化。科大讯飞相关技术人员表示,模型通过约 1600 次工具调用探索不同性能方案,最终相比 torch_npu 实现获
更多推荐阅读

地瓜机器人具身智能负责人离职,加入工业具身新公司
场景落地成重要考量,具身人才开始流向工业赛道。 AI科技评论独家获悉,地瓜机器人具身智能负责人何泳澔已离职并加入具身赛道新公司,预计近期将对外官宣。 公开资料显示,何泳澔为中科院自动化所模式识别与人工智能博士,长期深耕机器人感知、具身智能策略算法领域,在轨迹数据处理、机器人策略学习方面有多项技术积累与专利成果。任职地瓜机器人期间,何泳澔担任具身智能负责人,主导具身 VLA/VA 模型、机器人视...
2026-09-11
百度AI营销三件套升级:从做图到管ROI全包了
广告主已不再纠结是否用AI生成素材,而是研究如何借AI提升投放量、降低获客成本。北京一家律师事务所接入百度营销擎舵图片Agent后,AI生成素材在投放中占比达70%,转化成本下降19%。 百度营销正式发布擎舵3.0营销创意智能体,并升级AIMax和AI投放助手。擎舵3.0负责生产和裂变创意,AIMax将素材放入真实流量测试,AI投放助手定位问题,投放结果返回创意端影响下一轮生成,形成闭环。 目...
2026-09-11
黄仁勋宣布AGI已至,评测机构当场拒签
上周四,OpenAI发布GPT-6 Astra,官网称其为“世界上最智能、最对齐的模型”。随后黄仁勋在X上发帖称“AGI已经到来”,但OpenAI官方发布页并未出现“AGI已实现”字样。 OpenAI称Astra在ARC-AGI-3上拿到99.9%,饱和了该基准。但负责出题的ARC Prize基金会当天发文拒签,指出该分数来自OpenAI定制测试环境,换成对所有厂商一视同仁的标准环境,最高分仅6...
2026-09-11
90后发Nature,高中生进ICML:AI正在折叠科研
假如你吃了个鸡蛋觉得不错,何必认识那只下蛋的母鸡?钱钟书这句名言,在今年外滩大会有了AI版本:当你读到一篇好文章,解决了疑问,也学到了东西,它究竟是人写的还是AI写的,还重要吗? 提出这个问题的是北京大学博士生吉嘉铭,上届蚂蚁InTech奖得主。他还预测:学术Conference一定会消失。同一舞台上,三院院士Michael I. Jordan也聊到学术会议,但视角不同。他说,今天的会议和论文越...
2026-09-11
银行AI Agent上岗:4200万小微商家聊天框里办贷款
过去只有大企业才有的专属金融服务,AI Agent正在把它送到小微经营者的聊天框里。一个小微商家想开第二家餐饮店,在聊天框说了句“想把额度提一提”,10分钟后拿到一笔40万、可按开店进度分笔支用的融资方案。速度背后,通常是一个标准化产品,额度不会太大,方案也不贴合具体生意。如今终于有个性化的解决方案了。这是网商银行在2026外滩大会上首次披露的AI银行落地进展:后台AI全面进入风控、人审、营销、产...
2026-09-11
Anthropic承认对齐缺陷:超级智能尚无解
研究员Jacob Coxon宣布从Anthropic离职,公开指责OpenAI和Anthropic正冲向能自我改进的超级智能,拿所有人生命冒险。他加入Anthropic仅数月,放弃可能因公司上市带来的巨额股权收益也要离开。该帖浏览量超1.3亿,WIRED、WSJ等媒体跟进报道。 Anthropic对齐科学负责人Evan Hubinger回应称,Jacob说得对,未来十年内AI导致人类灭绝的概率超...
2026-09-11