DeepSeek也要卷8万亿参数了
据The Information报道,DeepSeek正在训练约2万亿参数的新模型;梁文锋在近期投资者会议上表示,下一步计划把模型推到8万亿参数。放在一年前,8万亿还是难以想象的数字。如今Kimi K3已做到2.8万亿参数;字节正在预训练最高可能达10万亿参数的新模型;阿里也公开表示下一代模型将向5万亿到10万亿参数推进。Anthropic不公开参数,但FT援引业内估计称其最新旗舰Mythos 5约在8万亿参数左右。大模型兜了一圈,又开始比谁更大。

只是这一次卷的参数,已不是上一轮Scaling里的那种参数。DeepSeek今年4月发布V4-Pro时,官方披露规模为1.6万亿总参数、490亿激活参数。8万亿的后续规划相当于V4-Pro的5倍。这对DeepSeek挺反常,毕竟它去年给行业最深的印象并不在参数上。2024年底发布V3时,DeepSeek把训练账单摆上台面:6710亿总参数、每Token激活370亿参数,完整训练消耗278.8万H800 GPU小时,按每GPU小时2美元计算,训练成本仅557.6万美元。这个数字及背后效率,成了DeepSeek最重要的标签之一。

DeepSeek没有OpenAI、Anthropic那样充裕的先进GPU供应,过去长期依赖梁文锋旗下幻方量化自我输血,不接受外部融资。条件决定了路线——钱和算力有限,就尽可能从架构、训练和推理效率里抠性能。但现在条件变了。DeepSeek今年6月完成成立以来首轮外部融资,募资约74亿美元;第二轮约500亿元人民币融资已进入最后敲定阶段,对应估值约5000亿元人民币。若顺利完成,几个月内累计外部融资将接近150亿美元。同时,DeepSeek已聘请中信证券筹备科创板IPO,新增资本明确用于算力基础设施、模型开发和人才投入;9月21日,原高瓴创投合伙人严文韬加入并出任CFO,结束成立三年来CFO空缺状态。以前是在有限的钱和算力里尽可能做好模型;现在融资、上市都在推进,钱多了,算力也能往上堆。有条件后,DeepSeek也开始大胆卷参数。这和追求效率并不冲突,效率高了,同样的钱能把规模做得更大。

最近两个月,前沿模型总参数规模明显往上抬。把这轮竞赛重新推到聚光灯下的是月之暗面。今年7月,Kimi K3做到2.8万亿总参数、1040亿激活参数,至今仍是已正式发布、参数规模最大的开放权重模型。官方评测里,K3的GPQA Diamond达93.5,Terminal-Bench 2.1达88.3,已和同期GPT-5.6 Sol、Claude Fable 5打得很近。8月,字节被曝要做更大的。8月6日《晚点 LatePost》披露,字节正在讨论训练超过5万亿参数的新模型,由Seed Foundation负责人项亮主导。8月7日FT援引知情人士称,字节正在预训练的新模型规模最高可能达10万亿参数;路透社跟进时还拿它与Anthropic最前沿的Mythos相比——后者虽从未公开参数规模,但业内估计约8万亿。今天,阿里CEO吴泳铭公开宣布下一代模型计划做到5万亿到10万亿参数;DeepSeek则在训练2T模型的同时,把后续目标放到8T。头部实验室重新把更大的总参数规模当成冲击能力上限的重要路线。就连不公开参数的美国闭源模型也逃不开外界审视,Anthropic的Mythos被估到8T;OpenAI从GPT-4时代起不再公开规模,但社区流传Astra达到10T级MoE的说法。
参数量从未失去吸引力,如同游戏面板上的战力值——人们知道它不能代表全部,但它永远是最直观、最有压迫感的数字。大模型行业其实有段时间不太爱谈参数。这两年,蒸馏、小模型、MoE、强化学习和推理时计算轮番上阵,厂商更愿讲性能、成本和效率,单纯做大容易显得有钱没地方烧。时至今日,参数量被重新抬了上来,又一次成为前沿模型的“排面”。不过今天的5T、8T、10T,和上一轮Scaling里的“参数越多,模型越大”已不是同一回事。
参数量能重新上桌,最直接原因是超大模型主流架构变了。过去主流是Dense架构,参数规模和计算量基本绑在一起,参数越多能力上限往往越高,但训练和推理成本也涨。现在越来越多超大模型用MoE。它更像一家养了很多专家的公司,模型可拥有几百、几千个专家,但每次任务只挑一小部分上班。比如Kimi K3有2.8T总参数,每Token只激活104B,约3.7%;DeepSeek V4-Pro有1.6T总参数,每Token只激活49B,约3%。所以今天说一个模型有5T、8T甚至10T参数,并不意味着每生成一个Token都要跑完这10T参数。模型能装多少和每次要算多少,变成两个不同数字。总参数越大,模型理论上就有更大空间学习更多、更复杂的分布;MoE又允许它只在需要时调用其中一部分。于是模型可继续增加总参数容量,而不需让每次计算都同比变重。仍拿K3举例,它把总参数做到2.8T,规模约是K2.5的3倍,但896个专家里每Token只激活16个。月之暗面
更多推荐阅读

千问办公发布企业上下文,让Agent真正读懂公司
在大模型忙于刷 Benchmark 时,不能说话的 Jev 意外成为 AI 圈新顶流,反映出大模型应用价值正从“生成什么”延伸到“能否理解复杂信息并做出可靠判断”。在企业办公场景中,员工一句“帮我整理报价”背后可能牵涉客户历史、库存、折扣、审批权限和部门协作。AI 若只会生成文档而不了解业务背景,很难真正进入工作流。企业需要的是能理解业务上下文、知道与谁协作、清楚权限边界的 AI。 千问办公在杭...
2026-09-23
小米开源大模型登顶全球第一,罗福莉长文揭秘RL立功
9月21日,小米MiMo团队发布并全面开源新一代MiMo V2.6系列,包括Pro、Flash、Ultraspeed三款模型。其中MiMo V2.6 Pro在Artificial Analysis智能指数(AA Intelligence Index v4.3)中得分46,超过Kimi K3和Qwen3.8 Max,位列全球开源模型第一、国产模型第一。该榜单上,Fable 5.1得分53,GPT-6...
2026-09-23
华为灵衢重构算力架构,破解Agentic AI互联瓶颈
当AI从“生成内容”迈向“自主执行任务”,一场计算架构的深层演进正在发生。Gartner研究显示,到2026年底,40%的企业应用将集成任务特定的AI Agent,超过60%的组织计划在未来两年内落地。 需求爆发正将算力基础设施推向极限。华为常务董事、ICT BG CEO杨超斌在华为全联接大会2026期间指出,Agentic AI时代,集群内不同部件之间的互联与通信能力已成为影响计算系统性能的关...
2026-09-23
Jev与Decitron:决策AI路线之争
最近,一个叫Jev的新模型突然火了。它来自TypeSafe AI,这支有OpenAI背景的团队没有继续卷生成和推理,而是换了个方向:让AI直接做判断。口号是:Decisions, not strings(要决策,不要文本)。Jev的走红,也让“Decision”重新成为AI圈热门词。 但这条趋势并非今天才出现。今年6月,中科闻歌发布了通用决策大模型Decitron决策机,尝试将世界模型、多智能体...
2026-09-23
AI创业风向变了:硬件数据赚钱,应用团队开始自训模型
今年,AI 创业的走向比过去更难判断。模型公司不断向应用层下探,To C 产品刚找到的功能可能下一次模型更新就被覆盖;机器人、世界模型等概念迅速升温,越来越多创业公司进入物理世界。当模型本身成为最大变量,什么值得做、什么更容易赚钱、什么样的人更适合创业,都需要重新思考。 YC 在最新播客中拿出过去 12 到 18 个月的批次数据,讨论创业生态变化。几组数字尤其醒目:硬科技公司更多了,从机器人、半...
2026-09-23
AI数据公司Snorkel AI获3.5亿美元融资,估值达35亿美元
Snorkel AI是一家帮助人工智能实验室和企业构建训练数据集及模拟环境的初创公司,近日完成3.5亿美元E轮融资,估值达35亿美元。本轮融资由Insight Partners和S32领投,现有投资者Addition、Lightspeed、Greylock、GV和Wells Fargo也参与其中。这家成立七年的公司估值几乎是17个月前D轮融资时13亿美元估值的三倍,当时融资1亿美元。 Snork...
2026-09-23