AREX Feed Article
社区 CUDA 引擎 ds4-on-spark v0.5 将单 DGX Spark 解码推至 28 tok/s:prefill 破千,多智能体并发 59 tok/s
8 月 1 日,独立开发者 entrpi 在 NVIDIA 开发者论坛发布了 ds4-on-spark v0.5——一个基于 antirez/ds4(DwarfStar 4)的 Blackwell CUDA 深度优化分支,专为单台 DGX Spark(GB10, 128GB)调校。该版本随 DeepSeek V4 Flash 0731 权重同日发布,将单台 DGX Spark 上的实测性能推至此前的近 1.7 倍。
关键性能跃升
entrpi 公布的实测数据(全部在单台 GB10 上完成):
- Prefill:2K 上下文约 960 tok/s,最佳前沿突破 1,000 tok/s;518K token 上下文摄入速度 776 tok/s 持续
- Decode:12K 上下文聊天场景约 28 tok/s(含 DSpark 推测解码),240K 上下文仍维持约 22 tok/s;结构化输出(代码、数学)更高
- 多智能体并发:12 并发请求下聚合吞吐 59 tok/s
- 上下文容量:单会话 100 万 token 对话验证通过;跨会话 766K+ token 实时容量
- 对比上游:prefill 为上游引擎的 2.4–3.3 倍,decode 为 1.33–1.47 倍
安装仅需一条命令:
curl -sSL https://raw.githubusercontent.com/entrpi/ds4-on-spark/main/install.sh | bash -s -- --start项目自 5 月起累计 486 次提交、14.5 万行新增代码,GitHub 已获 204 颗星。
与此前报道的对比:技术路径分化
此前报道中,单 DGX Spark 的实测最佳成绩为 16.5 tok/s(IQ3_XXS 量化,llama.cpp 加载)。entrpi 的方案并非简单调参,而是引擎层面的根本差异:
| 维度 | llama.cpp GGUF(此前报道) | ds4-on-spark v0.5(本次) |
|---|---|---|
| 量化方案 | Unsloth IQ3_XXS / IQ2_M | antirez 非对称 Q2(81 GiB) |
| 推测解码 | 未合并(PR 已关闭) | DSpark 内建,准静默激活 |
| Decode(12K) | ~16.5 tok/s | ~28 tok/s |
| Prefill(2K) | ~411 tok/s | ~960 tok/s |
| 启动时间 | ~6.5 分钟 | ~17 秒 |
| 多智能体并发 | 不支持 | 59 tok/s aggregate |
日本 Classmethod 工程师 Morishige 的独立对比也确认了 llama.cpp 与 DwarfStar 4 在 decode 速度上的相近水平(17 vs 16.5 tok/s),但其测试基于未启用推测解码的 llama.cpp。entrpi 的方案通过定制 CUDA kernel、连续批处理、前缀缓存和 DSpark 推测解码的组合实现了数量级突破。
DSpark 权重映射 Bug 被发现并修复
论坛用户 tonyd2wild 在升级至官方 0731 权重后发现 2×DGX Spark 的 decode 吞吐减半——从预览版的 ~60 tok/s 降至 ~32.7 tok/s。经过诊断,问题出在 vLLM 的 DSpark 草稿加载器:shared_experts.w1/w3 未映射到 gate_up_proj,导致共享专家权重在草稿阶段未被初始化,12 个张量静默丢失。修复后吞吐恢复至均值 55.4 tok/s,峰值 66.1 tok/s,草稿接受率从 25.7% 回升至 60.2%。该发现独立验证了 DSpark 推测解码的「速度可损、正确性不变」设计原则。
与前期报道的关系
此前三篇报道已覆盖:MIT 开源与 vLLM 官方支持、HF 免费端点、Harness 内测招募、以及单/双 DGX Spark 和 4×3090 的本地部署方案。本次更新记录了两个方向的新进展:
- 引擎层突破:entrpi 的自研 CUDA 引擎将单 DGX Spark 的可用性从「勉强能跑」提升至「实用级」,证明消费级 Blackwell 硬件可通过定制 kernel 释放远超通用推理引擎的性能
- 部署质量保证:tonyd2wild 发现并修复的 DSpark 权重映射 Bug,为社区 2×DGX Spark 部署者提供了关键补丁
硬件指南网站 kingy.ai 在评测中指出「单台 Spark 运行的是模型的极度压缩表示」——entrpi 的工作正是在这个约束下将工程效率推至当前极限。
待观察
- entrpi 方案使用非对称 Q2 量化(81 GiB),模型质量损失相对 IQ3_XXS 的差异尚未有独立基准测试
- 项目为个人维护分支,与上游 antirez/ds4 的长期兼容性取决于合并意愿
- BenchLM 平台指出,截至 8 月 2 日,其 DeepSeek V4 Flash 页面的 22 条基准记录仍来自 4 月 Preview checkpoint,0731 的独立评测数据尚未覆盖