AREX Feed Article
vLLM 在 DeepSeek-V4.1-Flash 发布当天上线官方部署配方,并启动三项内核集成
9 月 10 日,DeepSeek-V4.1-Flash 发布并开放权重当天,vLLM 官方账号在 06:50 UTC 对它的“day-0”支持(发布当天即可部署),并公布官方 Recipes :想要自建这套权重,需要 vLLM 0.30.0+ 和专用 Docker 镜像 vllm/vllm-openai:deepseekv41-flash-0909。
在宣布后约 37 分钟,07:27:49 UTC,vLLM 的 GitHub 仓库里出现一条跟踪 ,标题为“DeepSeek-V4.1-Flash kernels integration”,正文声明“我们正在把这些内核集成进 vLLM”,要集成的三项是 DeepGEMM、DeepSelect 与 FlashMLA。当天晚些时候,对应的三个集成 PR 陆续开出。
V4.1-Flash 的公司口径为 552B 参数 MoE、支持原生视觉;,称将与开源社区协作推进推理支持,并向“2,000 卡加存储集群”级别的大规模部署方发出了洽谈邀请。
配方给出的部署下限:只用 Docker,614 GB 显存门槛
配方页写明没有 pip wheel 支持这套架构,安装部分只提供 Docker 镜像。示例命令采用 4 卡张量并行(TP4):
docker run --gpus all \ --privileged --ipc=host -p 8000:8000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ -e VLLM_ENGINE_READY_TIMEOUT_S=3600 \ -e VLLM_USE_RUST_FRONTEND=1 \ vllm/vllm-openai:deepseekv41-flash-0909 deepseek-ai/DeepSeek-V4.1-Flash \ --tokenizer-mode deepseek_v41 \ --tensor-parallel-size 4 \ --tool-call-parser deepseek_v41 \ --enable-auto-tool-choice \ --reasoning-parser deepseek_v41 \ --mm-encoder-tp-mode data硬件矩阵覆盖 NVIDIA 的 H100 80G、H200 141G、B200 180G、GB200 NVL4 192G、B300 268G、GB300 NVL4 288G,以及 AMD 的 MI300X 192G、MI325X 256G、MI350X 与 MI355X 各 288G;vLLM 称这些支持已在 NVIDIA 与 AMD GPU 上验证。配方里写明的 1P1D(Prefill/Decode 分离)布局是在 GB200 NVL4 上验证的:Prefill 与 Decode 各占一台 4 卡托盘、每池 TP4,KV 经 NIXL 传递,前置 vllm-router。
容量上,检查点磁盘占用约 511 GB(476 GiB),最低显存要求 614 GB(按 1.2 倍余量系数计):TP4 下刚好放进一台 GB200 NVL4 托盘(768 GB),或一台 8 卡 H200 节点(1,128 GB)并留出 KV 空间;1M 上下文则要下调上下文长度或批大小。第一次加载很慢,配方为此把引擎就绪超时设成 3,600 秒。
配方页还有两个提示:文本任务加 --language-model-only 可跳过视觉编码器,把显存让给 KV 缓存;thinking 默认开启(effort 50),max_tokens 给小了,预算会全花在思维链上,返回的 content 为空,配方页的提醒是“这看起来像模型坏了,其实不是”。
配方页里的架构数字:Engram、四层压缩 KV 与 DSpark
对已经在 vLLM 上跑 DeepSeek-V4 的团队,vLLM 说这套栈的大部分都眼熟:hyper-connections、滑动窗口加压缩稀疏注意力、DSpark 草拟、MXFP4 专家权重自 V4 起就已支持;新增的是 Engram 与四层写压缩 KV 的做法。配方页给出的关键数字:
- Engram 查表记忆:第 1、14 层各挂一张约 384M 行 × 256 维的哈希表,用输入 4-gram 的哈希查表,经学习到的门控写进残差流;两张表合计 196.6B 参数(约 189 GiB),配方页提醒容量规划要优先考虑它们,因为除专家权重外它们占比最大。vLLM 推文的概括是:检查点约四分之一是模型靠查表、而非计算得来的 n-gram 记忆。
- 只有四层写压缩 KV:整个模型只有第 2、8、14、20 层压缩自己的 KV,其余层共享这份缓存;V4.1 只用压缩比 1 和 2,而 V4 用的是 4 和 128。此外每层都有一个 128 token 的滑动窗口,压缩层把 KV latent 池化后交给一个索引器打分,每个 query 保留最优 512 个,前置候选阶段先从 2,048 个 8 token 块里筛选。
- DSpark 草拟头:三个阶段,每阶段 128 个路由专家(激活 3 个),一次草拟 5 个 token,读取第 37~39 层的注意力输入。
- 混合量化检查点:路由专家权重是 MXFP4,其余权重为 MXFP8 块量化,统一用 UE8M0 scale;embedding 与 LM head 保持 BF16。
模型骨架是 40 层、hidden size 5120,前置 32 层 ViT;读输入时激活 8B、写输出时激活 16B;1M token(1,048,576)上下文靠 YaRN(factor 16)从 65,536 token 的训练窗口外推。
内核分工,与当天开出的集成 PR
由 ZJY0516 创建,标签为 feature request、deepseek、DSv4。正文按内核分工到人:DeepGEMM 的 Mega-Gate 与 Mega-mHC 归 gau-nernst、Sparse Indexer 归 JaredforReal;DeepSelect 归 ZJY0516;FlashMLA 归 zyongye。
DeepSeek 侧的 (标题“Public Release 26/09”)在当天 06:31 UTC 合入,为 V4.1 新增了 Sparse Indexer(分层稀疏索引,吞吐接近 Lightning Indexer)、融合 MoE 路由的 Mega Gate 与融合 Hyper-Connection 与 RMSNorm 的 Mega mHC;该 PR 说明给出的提速分别为 30%~75% 与 45%~85%。 是稀疏注意力(DSA)与采样器的 TopK 内核,9 月 9 日建仓、9 月 10 日发布 v1.0.0; 是 DeepSeek 的注意力内核库。
vLLM 侧的三个对应 PR 也在当天开出:10:27、10:56、12:33 UTC 先后创建。(JaredforReal)把 DeepGEMM 2.8 的稀疏 MQA-logits 内核接进 V4.1 的索引器; 与 (均为 gau-nernst)分别集成 Mega-mHC 与 Mega-Gate。#56254 的 PR 描述给出作者自测:收益集中在长上下文,128K 上下文的 prefill 微基准最高 24.2 倍,端到端“解码为主”负载(4 条 100K token 提示词)从 6.85 秒降到 3.08 秒;不过这条路径默认关闭(需设 VLLM_DSA_SPARSE_MQA_LOGITS=1),且限定在 SM100 级 GPU 与 MXFP4 索引缓存上。#56255 同时注明,Mega-mHC 不支持 Engram 层,遇到 Engram 时改用现有的两个 tilelang 内核。
SGLang 同日给出 day-0 支持与一份性能预告
比 vLLM 早约 36 分钟,SGLang 官方账号在 06:14 UTC 对 V4.1-Flash 的 day-0 推理与 RL(强化学习)支持,覆盖 SGLang 与 Miles,并列出压缩 KV 跨层共享、两段式稀疏索引器等架构要点。推文末尾留了一句预告:未来几天会有“非常令人兴奋”的性能升级。
尚未落地:内核合入状态与两个参数量口径
截至发稿,issue #56217 与三个集成 PR 都还是 open 状态(其中 #56266 标为 draft)。
另一个悬置是参数量:vLLM 配方页写 522B 总参数,而 DeepSeek 的发布公告与 vLLM 自己的推文写 552B。同一个模型、同一天,两个数字并存。
接下来可验证的两个信号是:三个集成 PR 何时从 open 变为 merged,以及 SGLang 预告的性能升级是否兑现。
参考链接
- vLLM(@vllm_project)公告推文:
- vLLM Recipes:DeepSeek-V4.1-Flash 部署配方:
- vLLM 仓库 issue #56217(内核集成跟踪):
- DeepSeek DeepGEMM PR #432(Public Release 26/09):
- DeepSeek DeepSelect 仓库:
- DeepSeek FlashMLA 仓库:
- vLLM PR #56254(稀疏 MQA-logits 接入索引器):
- vLLM PR #56255(集成 Mega-mHC):
- vLLM PR #56266(集成 Mega-Gate):
- SGLang(@sgl_project)公告推文:
- DeepSeek 发布公告:
- DeepSeek-V4.1-Flash 权重(Hugging Face):