DeepSeek V4.1 Flash评测超Pro,官方却两次改口不下线

DeepSeek V4.1 Flash评测超Pro,官方却两次改口不下线

AI 资讯 来源:新闻/公众号 发布时间:2026-09-12 更新于 2026-09-12 预计阅读 4 分钟

DeepSeek V4.1 Flash 正式上线后引发广泛关注。Artificial Analysis 测试给出 40 分指数评分,超过参数量更大的 DeepSeek V4 Pro。DeepSeek 曾两次调整决定,先延迟下线 V4 Pro,随后放弃下线并继续提供 API 服务。

DeepSeek V4.1 Flash用了哪些黑科技?竟让Flash(差点)逼退Pro

评测显示,V4.1 Flash 在智能体能力和长上下文推理方面进步明显,以 69% 在 AutomationBench-AA 上排名第一,与 GPT-6 Astra 持平,略高于 Grok 4.6 的 67%。它也是测得冗长度最高的模型之一,每个 Intelligence Index 任务消耗 89k Tokens,但成本仅 0.27 美元,主要得益于低定价。Sebastian Raschka 认为其创新之大,应称为 DeepSeek V5。

DeepSeek V4.1 Flash用了哪些黑科技?竟让Flash(差点)逼退Pro

技术报告标题为《DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression》,核心目标是压缩 KV 缓存。V4.1-Flash 全局 KV 缓存压至每 token 890 字节,约为 V4-Flash 的 1/4,相比 DeepSeek-V1 的 389,120 字节差距达 437 倍;持久化 KV 缓存压至 V4-Flash 的约 1/8。模型为 552B 主干参数加 196B Engram 参数的多模态 MoE,原生支持 100 万 token 上下文,在 45T token 多模态语料上预训练,prefill 阶段每 token 激活 8B 参数,decode 阶段激活 16B。

DeepSeek V4.1 Flash用了哪些黑科技?竟让Flash(差点)逼退Pro

报告指出,稀疏注意力已降低长序列计算成本,但长程 agent 负载输入重,瓶颈转向存储与搬运:HBM 容量限制并发请求的全局 KV,SSD 和主机内存限制前缀缓存命中率,IO 与互联带宽限制缓存迁移加载速度。V4.1-Flash 从架构、精度、部署三层次同时下手。

架构上,语言主干 40 层分为前 20 层因果编码器和后 20 层解码器,即 CED 结构。解码器各层 KV 由第 20 层隐藏状态经各自投影矩阵映射得到,prefill 只需跑前 20 层,复杂度从 O(NL) 降至约 O(NL/2)。该思路继承自微软 YoCo,但 CED 为每层配置独立投影权重,扩大 KV 有效容量和生成深度。代价是 SWA 仍需逐层计算,DeepSeek 采用近似处理,只回放提示词最后 n_win 个 token,即 Decoder SWA Bounded Replay。

CSA2 负责存储压缩,将压缩空间归纳为条目大小、序列维度、层维度三个相乘维度。此前 IndexCache、YOIO、HySparse 均未覆盖全部三维,CSA2 为每个 CSA2 层静态分配 Full、Reindex、Reuse 三种模式之一,共同点是每层保留自己的全局 Q 和 SWA KV,避免层间表达能力被抹平。

精度上,V4 已对索引器 Q、K 做 FP4 量化感知训练,V4.1-Flash 将 FP4 推进到 main KV 缓存,采用 E2M1 配每 16 通道一个 E4M3 缩放因子,接近 NVFP4 但省去二级全局缩放。部署上则采用 SWA Bounded Replay,接受近似重建以降低生产部署代价。

标签: AI 资讯 AI

更多推荐阅读

数学家给世界模型立规矩,清雁科技融资上亿

数学家给世界模型立规矩,清雁科技融资上亿

2026年,世界模型成为热门概念,但定义混乱,视频生成、VLA、自动驾驶公司都自称世界模型。成立四年的清雁科技试图从数学底层寻找真正的世界模型,近期完成超亿元A轮融资,由君联资本领投,宁波亿时、苏州苏创投跟投。公司由清华大学与北京雁栖湖应用数学研究院共同孵化,核心团队包括董事长孙明明、董事汤珂、CEO张英伟和CTO王凡。 清雁长期专注数据基础设施与数学结合,判断数据基础设施正从服务机构转向服务模...

2026-09-12
OpenAI最快模型GPT-5.3-Codex-Spark下周退役,仅存活7个月

OpenAI最快模型GPT-5.3-Codex-Spark下周退役,仅存活7个月

OpenAI史上最快的模型GPT-5.3-Codex-Spark将于下周退役。Codex负责人Tibo给出的理由是用量持续下滑,且已有明显更好的模型,“是时候给未来腾地方了”。该模型从发布到下线仅存活7个月。 Spark上线于今年2月12日,是OpenAI首个专为实时编程设计的模型,128k上下文,每秒生成超1000个Token,客户端与服务器往返开销降80%,每Token处理开销降30%,首T...

2026-09-12
全球首场AI虚拟偶像线下演唱会,观众为何愿意买单?

全球首场AI虚拟偶像线下演唱会,观众为何愿意买单?

9月11日晚,2026外滩大会第三天,全球首个AI艺人线下音乐会举行,主角是国内首个被认证的数字人Yuri。现场除AI虚拟少女表演外,还加入真人伴奏、助唱房东的猫及仿生机器人唱歌。机器人表情僵硬,主创解释是现场信号不好所致。让AI与观众交互,是主创第一目标。 筹备过程充满实验性。演出前一天争论持续到凌晨四点半。Yuri开场那句“未必完美,务必发声”是AI自己说出来的。导演组原定结尾当天出问题,只...

2026-09-12
OpenAI把Codex拆开卖,Agent能力打包成API

OpenAI把Codex拆开卖,Agent能力打包成API

OpenAI一天内推出Agents API、GPT-Live-1 API、Data agent和ChatGPT for Financial Services四款产品,横跨Agent、语音、数据和金融四条线。其中Agents API最受关注,因为OpenAI把Codex的核心能力拆出来做成了云端API。 过去一年多,OpenAI持续拆解Codex:2025年4月开源Codex CLI;一个月后上线...

2026-09-12
15万Agent背后,谁在造企业AI工厂?

15万Agent背后,谁在造企业AI工厂?

当下AI圈,企业智能体是最火热的战场。国内外模型厂商一边推出AI办公智能体,一边搭建B端落地团队,从写代码、做文档延伸到金融、法律等真实企业场景。大厂也加速调整组织架构与产品策略,集体向下游补课。 AI产业的演变遵循一条规律:当一项技术成为基础能力后,定价权不会一直掌握在单一公司手上。头部模型玩家已意识到,卷模型参数的优势转瞬即逝,真正能构筑长期壁垒的是打通企业AI的最后一公里,把AI能力嵌入企...

2026-09-12
22人年入2100万美元,上海00后人均产出反超ElevenLabs

22人年入2100万美元,上海00后人均产出反超ElevenLabs

22 个人,一年干到年化收入 2100 万美元。对面的 ElevenLabs,580 人,年化收入 5 亿美元,估值 110 亿美元,41% 的财富 500 强在用。但算人均账:Fish Audio 人均年创收约 95 万美元,ElevenLabs 约 86 万——蚂蚁的人均产出反超了大象。这家公司叫 Fish Audio,中文运营主体上海奇塔灵动科技,创始人 00 后前英伟达研究员廖世嘉。起点是...

2026-09-12
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部