AREX Feed Article
vLLM 官宣已支持 V4-Flash-Vision-Exp,视觉支持尚未进入稳定版
北京时间 9 月 1 日 17 时,发文祝贺 DeepSeek 发布 V4 家族首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,并宣布「vLLM serves it now」——vLLM 现已支持该模型。推文给出的架构口径是:在 285B/13B 的 V4-Flash MoE(混合专家)骨干上叠加视觉编码器与 aligner(对齐器),文本智能体分数保持稳定(text-agent scores holding steady),并附上 链接。
一天前,DeepSeek 在 以 MIT 许可放出该模型权重,模型页标注 305B 参数。这是 V4 家族首个实验性多模态模型,基于 V4-Flash 架构集成视觉模块并继续训练;该模型 8 月 21 日已上线 DeepSeek API 平台,8 月 31 日开放权重()。
发布当天的核查:上游 vLLM 尚无 deepseek_v4 视觉支持
以下时间均为北京时间。权重发布当天,的 DGX Spark/GB10 板块出现社区核查帖。18:51 主题创建,19:24 用户 0rand 贴出核查结论:权重确认为原生视觉架构(native vision),不是外挂视觉塔;但上游 vLLM main 对 deepseek_v4 没有任何视觉支持——DeepseekV4ForCausalLM 映射的 nvidia/model.py 中 0 处 vision、image、aligner 或 multimodal 引用,注册表里没有 deepseek_v4 的多模态处理器(multimodal processor),也没有相关 PR。
0rand 同时核对了社区流传的两条路径:eugr 补丁仓库的 recipe 是纯文本服务配置(带 B12X kernel 性能补丁),只覆盖 0731 文本配方,没有任何视觉内容;名为 FlyCockpit/DeepSeek-V4-Flash-0731-vision 的仓库是 LoRA(低秩适配)适配器加独立视觉塔(deepencoder_v2_tower.safetensors)拼在 0731 上的方案,并非官方权重。
结论是:文本路径当天就能用标准 vLLM 跑通,视觉端补丁「还不存在,没有人写过」。
20:23,正在开发 0xSupergemma 的 Jun Song 发帖称权重已开放,「看起来和 GLM-5.3-Flash 打平」,正在对比测试。
21:46,发布公告帖,链接 modelscope.cn 镜像页,并复述官方基准口径:Agents' Last Exam 与 ZeroBench 超过 Opus-4.8,Terminal-Bench 2.1(83.9)与 DeepSWE(59.3)高于 Opus-4.8 的 58.0,Chartography 落后 0.7。
「serves it now」,但视觉支持还没进稳定版
当天 20:41,GitHub 用户 Isotr0py 向 vllm-project 提交 (「Add DeepSeek-V4-Flash-Vision-Exp support」),距 Jun Song 发帖确认权重开放约 18 分钟;截至发稿该 PR 仍为 open 状态,未合并进主分支,PR 说明提供了 docker 镜像并指向 recipes 页。次日 17:00,vLLM 官方账号正式宣布支持。
recipes 页在「Prerequisites」一节写明了这条声明的边界:视觉支持还没有进入任何稳定版 vLLM,目前存在于 PR #54566 中;合并之前必须使用 pinned 镜像(固定版本镜像)vllm/vllm-openai:deepseekv4-flash-vision,官方 wheel 会把该 checkpoint 路由到纯文本类别,并在视觉张量上直接报错。
同一页给出了支持细节:模型保留 V4-Flash 语言骨干(43 层、256 个路由专家、每 token 激活 6 个、1,048,576 token 上下文窗口),新增 32 层、1,024 维的 ViT(视觉 Transformer)与两层 aligner(recipes 页称约 0.5B 参数,叠在 284B 骨干上);权重 FP4/FP8 混合,检查点 48 个分片、约 168 GB。
支持范围目前限 NVIDIA:ROCm 与 XPU 构建在模型构造时直接抛 NotImplementedError,GB200 是唯一有已发布视觉运行记录的硬件(OCRBench 全量 1,000 样本 835/1000,即 83.5%);1M 上下文是宣传值,参考运行用的是 32K。
独立复核:11 项基准中 8 项落后 Opus-4.8
在发布当天 22:00 的独立报道给出了与官方宣传不同的读法:按官方模型卡上的 11 项基准,该模型 8 项落后于 Opus-4.8。赢下的是 DeepSWE(59.3 vs 58.0)、Agents' Last Exam(27.3 vs 25.7)与 ZeroBench Pass@5(35.0 vs 34.0);落后最多的是 NL2Repo(57.7 vs 69.7)和 DSBench-Hard(63.6 vs 71.7)。
智东西的报道称后两项与 Opus-4.8 仍有约 10 个百分点差距,「在高度复杂、结构化的数据科学任务上仍有优化空间」。
ApexBench 一项:Vision-Exp 的 36.5 较 0731 的 26.2 提升明显,但模型卡注释注明,0731 在 ApexBench 与 Agents' Last Exam 上忽略输入中的多模态元素,对照组并不对等;且 36.5 仍低于 Opus-4.8 的 39.4。
所有数字均出自 DeepSeek 官方模型卡(DeepSeek Harness minimal 模式、max 推理强度、temperature 1.0、top_p 0.95),属当事方自测口径。
AI Weekly 还补充了两个细节:API 定价与纯文本 V4-Flash 完全相同(非高峰 $0.22/$0.66 每百万 token,UTC 高峰时段翻倍;图像按 token 计费、每张上限 384 token,无多模态加价);此次发布没有配套论文或博客。
自测的分数与未合并的 PR
目前两件事悬着。一是基准分数:官方智能体基准(ApexBench、Agents' Last Exam 等)的数字全部出自 DeepSeek 自测的模型卡;AI Weekly 的独立分析基于这张表,vLLM 的 OCRBench 835/1000 是它在 GB200 上跑的另一个基准,均非对官方基准的重测。二是支持状态:PR #54566 仍未合并,视觉支持未进稳定版,本地跑视觉服务目前只能使用 pinned 镜像,且仅限 NVIDIA 硬件。