AREX Feed Article
DeepSeek 正式发布并开源 DeepSeek-V4.1-Flash:552B MoE 启用 Causal Encoder-Decoder 新架构,KV 缓存降至前代 1/4 HBM、1/8 SSD
北京时间 2026 年 9 月 10 日 14:10(UTC 06:10),DeepSeek 官方 X 账号 @deepseek_ai 以由六条推文组成的推文串官宣发布并开源 DeepSeek-V4.1-Flash:一个 552B 参数的 MoE(混合专家)模型,采用新的 Causal Encoder-Decoder(因果编码器-解码器)架构,原生支持视觉理解,API 以 deepseek-flash 名称上线。发布时该账号粉丝约 112 万。模型权重与一份 51 页的技术报告已同步出现在 deepseek-ai 组织的 ,仓库采用 MIT 许可证。公告中的基准成绩均为 DeepSeek 自报口径,截至发稿尚无独立复现。
这次发布把此前的预告落了地。DeepSeek 开放平台此前已发通知,计划于北京时间 9 月 10 日前后发布支持原生多模态的 V4.1 Flash,并安排 V4 Pro 的过渡计费;当天上午(北京时间 10:49)还观察到 DeepSeek 界面已将快速、专家、识图三种模式合并,不再单设专家模式。几个小时后,正式公告、开源权重和技术报告一并到位。
prefill 8B、decode 16B:新架构的激活拆分
给出了核心架构参数:输入阶段仅 8B 激活参数,输出阶段 16B 激活。技术报告对此解释得更为具体:模型在 decode(解码)阶段每 token(词元)激活 16B 参数,而在 prefill(预填充)阶段只激活 8B。称这一设计「显著改善了 agentic(智能体)工作负载的成本效率」,理由是长程智能体的普及使模型工作负载日益偏向输入,prefill 侧的低激活直接压缩了这部分开销。
技术报告摘要还给出了两个具体数字:模型支持最长 100 万 token 的上下文,预训练使用了 45 万亿(45T)token 规模的多模态语料。将 V4.1-Flash 定位为新架构家族中最小的模型,称其设计目标是更高能力、更快推理、更高吞吐,以及向更大模型扩展。开源仓库里不止有权重:包含 prompt(提示词)编码参考和一个最小化 PyTorch 推理实现,覆盖视觉编码器与对齐器、滑窗加压缩稀疏注意力及其两级索引器、engram n-gram 查找、MoE、Hyper-Connections 和 DSpark 前向路径。表示将与开源社区合作推进 V4.1-Flash 的推理支持,并向计划用 2,000 张 GPU 加存储集群做大规模部署的用户发出了邀约。
技术报告拆解 KV 缓存压减:HBM 侧 1/4,SSD 侧 1/8
这次发布的另一组数字落在 KV(键值,Key-Value)缓存上。称,与上一代相比,V4.1-Flash 的 KV 缓存只需 1/4 的 HBM(高带宽内存)和 1/8 的 SSD(固态硬盘)存储,理由是缓存命中计费往往占智能体应用成本的很大一部分。技术报告把这两个数字拆成了两套机制:通过 Compressed Sparse Attention 2(CSA2,压缩稀疏注意力)中的跨层 KV 缓存复用加上 FP4 KV 缓存,模型常驻 HBM 的全局 KV 缓存降到每 token 890 字节,约为 DeepSeek-V4-Flash 的 1/4;再通过一项名为 SWA Bounded Replay 的部署优化,常驻 SSD 或主机内存的持久化 KV 缓存降到 V4-Flash 的约 1/8。报告图 1(b) 给出了纵向对比:每 token 全局 KV 缓存从 DeepSeek-V1 的 389,120 字节、V3.2 的 48,068 字节、V4-Flash 的 3,514 字节降到 V4.1-Flash 的 890 字节,报告称相对 V4-Flash 和 V1 分别实现约 4 倍和 437 倍的压减。
这些数字同样出自 DeepSeek 自己的报告。报告称「尽管缓存占用小得多,模型仍比基线有实质上更好的表现」,但这属于开发者自评,报告之外的独立测试数据尚未出现。
API 换名 deepseek-flash,V4 Pro 将于 9 月 14 日按 Flash 价过渡
明确了 API 层面的变动:模型名设为 deepseek-flash;V4-Flash 与 V4-Flash-Vision-Exp 退役,旧模型名 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 会临时路由到 V4.1-Flash 以保证兼容。过渡安排写明了具体时间节点:自 2026 年 9 月 14 日 04:00 UTC(北京时间 12:00)起,所有 deepseek-v4-pro 请求将路由到 V4.1-Flash 并按 V4.1-Flash 的费率计费,直至 V4.1-Pro 推出。这一安排与科创板日报转述的平台通知一致——后者写的是北京时间 9 月 14 日 12:00 下线 V4 Pro 服务。
同时宣布了新定价:峰谷定价机制延续,谷时费率为峰时的 50%,新价格自 2026 年 9 月 10 日 04:00 UTC(北京时间 12:00)起生效——也就是说,在官宣推文发出时,新定价已经生效了约两小时。DeepSeek 还在公告中称官方合作伙伴 WorkBuddy_AI(含 Codebuddy)与 opencode 已完整支持 V4.1-Flash。
自报成绩与两套参数口径,仍待独立验证
公告中需要打问号的是性能声明。称新预训练方法加上更大规模的 RL(强化学习)后训练使基准成绩超过包括 DeepSeek-V4-Pro 在内的旗舰模型;则称「多方测试」显示 V4.1-Flash 在性能、成本、速度与总运行时长上领先 V4-Pro,因此逐步淘汰 V4-Pro。两处均为 DeepSeek 的单方表述,公告未列出测试方名单,截至发稿也没有独立机构发布复现结果。评论区已出现两类反应:有用户在中基于公告配图称 Flash 在 Terminal-Bench 上仍落后 Opus 5 13 分,认为这是一款走「便宜快」路线而非「前沿」定位的模型;则称这是他近期见过最令人印象深刻的架构之一。
另一个口径问题出在开源仓库本身。标注「Model size 485B params」,与公告的 552B 总参数口径对不上,两个数字之间的差异(如是否为不同统计口径)目前没有官方说明;模型卡标题还写着「DeepSeek-V4.1-Exp」,而非公告中的 V4.1-Flash。权重、技术报告和公告三者均已可公开查验,接下来的关键节点有两个:9 月 14 日 04:00 UTC 的 V4-Pro 路由切换,以及独立社区对自报基准成绩的复现。