AREX Feed Article
vLLM 官方支持 DeepSeek V4 Flash 0731:DSpark 推测解码内嵌权重,社区实测成本碾压 Opus 4.8
7 月 31 日,开源 LLM 推理引擎 vLLM(4.5 万粉丝)正式宣布支持 DeepSeek V4 Flash 0731 的官方开源权重,并确认 DSpark 推测解码模块已内嵌于模型权重中,部署时仅需一条 --speculative-config 标志即可启用,无需加载第二个 draft 模型。这是 DeepSeek 同日开源后首个主流推理框架的官方适配公告。
DSpark 内嵌权重:从「双模型」到「单 Flag」
vLLM 在公告中确认了此前未被强调的技术细节:V4 Flash 0731 的 304B 总参数量(HuggingFace 显示值)中包含额外的 DSpark 推测解码模块,基础 MoE 仍为 284B 总参 / 13B 激活。由于架构与 DSpark 预览版 checkpoint 一致,现有 vLLM 部署配置可直接沿用,推测解码通过以下单条配置启用:
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'vLLM 同时公布了模型结构参数:256 个路由专家、每 token 激活 6 个、100 万 token 上下文窗口、三个推理努力等级(reasoning-effort levels),并明确该模型「专为代码代理和工具调用构建」。vLLM 官方食谱页面(recipes.vllm.ai)已上线完整部署指南。
社区成本验证:Opus 4.8 级性能,1/18 价格
模型开放首日,社区涌现多项成本验证数据:
- Peter Dedene(Cursor 大使)发布对比截图,称 V4 Flash 0731 输入成本为 Opus 4.8 的 1/18、输出成本为 1/28,性能「匹敌 Opus 4.8」。
该推文 24 小时内获得 550 转推、9940 点赞、78 万次浏览。
- Elshayib(全栈开发者)展示其全天重度使用的 API 账单,称「几乎免费」,并特别强调缓存命中(Cache hits)机制带来的成本优势。该推文获得 2764 点赞、20 万次浏览。
独立平台 benchlm.ai 的实时对比数据进一步佐证:在聊天场景下,Claude Opus 4.8 单次成本 $0.0175,而 DeepSeek V4 Flash(High 推理模式)仅 $0.00028——差距约 62 倍。不过,多位开发者在 Dedene 推文下指出,V4 Flash 0731 的整体编码能力与 Opus 4.8 仍有差距,尤其在复杂任务上。
与前期报道的关系
此前报道已覆盖 MIT 开源、Unsloth GGUF 量化、Cline/OpenCode 生态接入。本次更新确认了推理层的关键拼图——vLLM 官方支持——以及开发者首日实测的成本反馈。Michael Burry(202 万粉丝)同日转发日经亚洲报道并评论称「真正的新闻是 OpenAI 大幅降价以备战」,但其引用的日经文章主要为既有事实综述,未提供新的实质性进展。