AREX Feed Article
SGLang 上线 2× DGX Spark 配方:V4-Flash-Vision 原生视觉,Flash-0731 支持 FP4/NVFP4
北京时间 9 月 4 日 07:05(UTC 9 月 3 日 23:05),发推宣布,为 DeepSeek-V4-Flash-Vision 与 DeepSeek-V4-Flash-0731 新增面向 2× DGX Spark 的部署配方。推文列出的要点是:Flash-Vision 原生支持视觉;Flash-0731 同时支持 FP4(4 位浮点量化)与 NVIDIA 官方 NVFP4;两者都跑在 b12x 内核库上。配方落在其 DeepSeek-V4 cookbook 页面,这套适配更新面向的是 DeepSeek 已开放的权重模型。
事件起点是 8 月 31 日 DeepSeek 在 发布的 DeepSeek-V4-Flash-Vision-Exp:模型卡称这是 V4 家族首个实验性多模态模型,在 V4-Flash 架构上加入视觉模块并继续训练,仓库标注 305B 参数、MIT 许可。,并表示“正在做支持,更新版 cookbook 即将到来(coming ASAP)”。
305B 模型装不进单台 128GB 的 Spark
给出的原因是:Flash-0731 与 305B 的 Flash-Vision-Exp 都放不进单台 128GB 内存的 DGX Spark(GB10),所以 DGX Spark 一行只保留三格配方,全部以 TP=2(张量并行度为 2)跨两台 Spark 运行,机器间经 ConnectX-7 走 RoCE(基于融合以太网的 RDMA)网络。
三格分别是 Flash Official(0731)的 FP4 与 NVFP4,以及 Flash Vision(Exp)的 FP4,策略统一为 Balanced、多节点。配方依赖专用预览镜像 lmsysorg/sglang:dev-v4f-2dgx-v2(b12x-vision 分支,commit 452239a74f),镜像内置 SM12x 上的 b12x MoE(混合专家)内核(W4A8,即权重 4 位、激活 8 位)、压缩 MLA 注意力内核(对应 PR #34878、#35899、#34018)、Flash Vision 模型支持(#37253)、b12x 图像 prefill 修复、NVFP4 MTP 层分发修复,以及 CuTeDSL 与 NCCL 固定版本。
文档提醒,这个镜像只用于 DGX Spark,不要在其他硬件上使用。推文配图正是 cookbook 的配置界面:从 DGX Spark(128GB)到 Flash Vision 305B Exp、FP4、Balanced、Multi-Nodes 一路高亮,界面为组合标注绿色 Verified 徽章。按文档对徽章的说明,绿色代表该组合已在真实硬件上端到端跑通,黄色则代表由相邻配置自动派生、尚未复核。
生成的双节点命令以 SGLANG_SM120_FLASHMLA_BACKEND=b12x 等环境变量开头,模型路径指向 deepseek-ai/DeepSeek-V4-Flash-Vision-Exp,参数为 --tp 2、--nnodes 2。运行细节同样写死在文档里:容器必须带 --network host 等参数让 NCCL 走 RDMA,否则会静默回落到 TCP,解码速度降低约 40%;PYTORCH_CUDA_ALLOC_CONF 需设为 expandable_segments:True,避免统一内存碎片化导致内存耗尽。
FP4 与 NVIDIA NVFP4 差在哪
Flash-0731 的两条量化路线,面向不同来源的权重。FP4 配方使用 DeepSeek 官方权重,文档称其 Instruct 检查点本身就以 FP4 MoE 专家加 FP8 attention/dense 的混合精度发布;NVFP4 配方对应 NVIDIA 官方量化检查点 nvidia/DeepSeek-V4-Flash-0731-NVFP4。
两条路线的实现细节不同。文档说明,NVFP4 版本只有路由专家(routed experts)真正走 NVFP4,attention、共享专家和 DSpark MTP 层仍保持检查点的原生格式;在 SM12x 上跑它还需要三个额外参数。
--moe-runner-backend flashinfer_cutlass,因为 b12x 的 MoE 只支持 MXFP4,而 trtllm-gen 的 FP8 内核仅面向 SM100;--speculative-moe-runner-backend b12x,让 DSpark 草稿的 MTP 专家走 b12x;--disable-shared-experts-fusion,因为 HashTopK 在 cutlass runner 下不接受融合的共享专家。文档的结论是:NVFP4 格的吞吐与 DSpark 接受率,和 FP4 格在噪声范围内持平。
原生视觉的代价:文本吞吐少约 15%~20%
对 Flash-Vision 来说,这次配方的增量是“原生”。用户按配方起服务后,直接以 OpenAI 风格的 image_url 字段把图片发给 /v1/chat/completions 即可,纯文本请求与文本版一致。图片能在 SM12x 上跑,靠的是预览镜像里的 b12x 图像 prefill 修复。
文档同时给出代价:该检查点捆绑的 DSpark 草稿头接受率约 3.2(Flash Official 约 3.9),文本吞吐因此比 Flash Official 低约 15%~20%,文本准确率不受影响。这条视觉通道目前整体仍是预览状态:数据中心 GPU 上的 Flash Vision 配方同样使用预览镜像 lmsysorg/sglang:dev-dsv4-flash-vision,文档写明,Flash Vision 的模型支持尚未随任何 release 发布。
说明支持已加入 cookbook、“正在不同配置和硬件上逐一核验”,这份双 Spark 配方正是这条核验线的又一站。
置灰的 FP8,和被追问的转正时间
截至本文核验时,公告推文累计 195 次点赞、121 次收藏、22 次转发、8 条引用。用户 @hhhppp09317668 直接问;配图中 Flash-Vision 一格的 FP8 与 NVFP4 选项都是灰色。文档说明,DGX Spark 行只保留三个配方格,其余组合在配置页上被有意置灰。
也有用户点名要更多硬件配方:自称在 CAS ACSII 任生命科学总监的 Nilesh Tawari 留言;自述参与 SGLang 项目的开发者 Kai 引用推文说;开源项目 ANEMLL 引用推文说。
悬而未决的是预览构建的转正时间。自称用两台 DGX Spark 跑本地模型的用户 Yume_X 在回复里问:。
参考链接
- _