AREX Feed Article
Nemotron 3.5 Lightning 发布前后 24 小时,三大推理栈把优化写进了上游
公告比官方推文更早,代码已经进上游
8 月 11 日 NVIDIA 公布 Nemotron 3.5 Lightning 前后 24 小时里,vLLM、SGLang、Ollama 三家开源推理栈的 Day-0 支持公告全部上线,而且都带着合入上游的代码。
vLLM 的发布于 8 月 10 日,SGLang 的于 8 月 11 日 06:18 UTC 上线,都比 NVIDIA 官方 X 账号当天 13:00 UTC 的更早;Ollama 的也在 8 月 11 日当天发出。
三份公告之外,还有已经合入上游的代码:DSpark 集成、W4A16 量化草稿头、异步调度、Humming MoE/linear backend、ReplaySSM,由 NVIDIA 与推理栈团队共同写进 vLLM 和 SGLang;SGLang 另增 enable_thinking、thinking_budget 两个按请求推理参数。
图:SGLang Day-0 博客。纵轴为 PinchBench 准确率,横轴为完成 10,000 个任务所需 H100 GPU 小时;图上标注「Same Intelligence as Qwen3.6 and 30% Faster Smarter than Gemma 4」。
vLLM 发推祝贺,独立评测同日给出 24 分
vLLM 官方账号 8 月 11 日:「Run Nemotron 3.5 Lightning on vLLM today!」配文列出最高 4 倍吞吐、任务完成快 30% 两项数字,并称「也很高兴看到模型用开放数据集训练。恭喜 Nemotron 团队!」
独立评测机构 Artificial Analysis 在 NVIDIA 官方推文约 5 分钟后。按它的口径,Lightning 是 31.6B 总参数、3.6B 活跃参数的混合 Mamba-Transformer 模型,以 OpenMDW-1.1 许可开放商用。
Intelligence Index 得 24 分,比前代 Nemotron 3 Nano 高 9 分,与 gpt-oss-120b 持平,只落后体量约 4 倍的 Nemotron 3 Super(26 分)。提升最大的是 agentic 维度:GDPval-AA v2 上 +334 ELO,Terminal-Bench v2.1 从前代的 7% 提高到 24%。
速度上,评测在 DeepInfra 的 NVFP4 端点上测得中位输出约 670 token/s;NVFP4 量化的 Intelligence Index 仍为 24 分,接近无损。
LangChain 官方博客当天发布 Switchyard :145 个多步 agent 任务中只有 7% 的调用被路由给 Opus 4.8,总成本比单独跑 Opus 低 74%,准确率从 86.0% 降到 80.0%。
两篇 Day-0 博客,署名都是双方联名
两家 Day-0 博客的作者署名一致:vLLM 博客署名「NVIDIA Nemotron Team and vLLM Team」,SGLang 博客署名「NVIDIA Nemotron Team and SGLang Team」。适配在模型公开之前已经完成。
能这么快还有技术原因。两篇博客都写明,Lightning 除权重与投机解码栈外,架构与 Nemotron 3 相同,大部分性能工作落在运行时而非权重上。
模型本身接续 Nemotron 3 Nano 发布,开发中有 Nemotron Coalition 成员贡献评测方法、推理软件和数据集,并由 Nemotron 3 Ultra 蒸馏而来。权重以 BF16、NVFP4 两种精度在 Hugging Face、ModelScope、OpenRouter 和 build.nvidia.com 的 NIM 微服务上线,见 。
指出,这是黄仁勋 7 月底在 X 上首次公开为开源模型辩护之后,NVIDIA 发布的第一个开源模型。他当时对 Axios 说:「Free AI should be great for hardware. Free AI should be great for chips.」
CNBC 还提到,NVIDIA 称该模型可在笔记本或台式机的单块 GPU 上运行;公司代表在周一表示,NVIDIA 使用了蒸馏。
同样的架构,性能账记在运行时头上
vLLM 博客列出的上游贡献:DSpark 集成;草稿头量化到 W4A16;消除 draft-verify 循环里的 host-device 同步点并启用异步调度。部署目标从 DGX Spark、RTX PC、Jetson 一路排到 B300/GB300。
另外两项改动是:用 Hopper 优化的 Humming backend 替换默认 Marlin,以 W4A16 GEMM 内核跑 Nemotron 的非门控 ReLU2 MoE,值约 20% 吞吐,同样做法延伸到 dense 线性层;为 Mamba2 集成 ReplaySSM。
SGLang 上游拿到的是同一批工作:DSpark 集成、W4A16 量化草稿头、去同步点与异步调度。
三种投机解码各占一个位置:MTP 用模型内置预测头提议后续 token,DFlash 用扩散草稿模型并行生成整块候选,DSpark 混合两者、在 DGX Spark 上表现最好。vLLM 的建议是低延迟用 DSpark(H100、H200、DGX Spark),要最大吞吐就关掉投机解码。
图:vLLM 博客,DGX Spark 上无投机解码、MTP、DFlash、DSpark 四种配置的输出吞吐帕累托曲线。
按请求控制推理是这套模型给多模型系统准备的接口。SGLang 文档给出 enable_thinking(直接关掉推理轨迹)与 thinking_budget(推理 token 预算)两个参数,推理默认开启:编排器可以给规划、编码分配大预算,给提取、分类等例行步骤直接关推理。
vLLM 的公告同样写明支持按请求开关推理和可配置推理 token 预算。
Ollama 走本地路线:模型完全在自有设备上运行,1M token 上下文,支持 MTP/DFlash/DSpark。ollama launch claude / openclaw / hermes / opencode 各一条命令,就能挂进 Claude Code、OpenClaw、Hermes Agent、OpenCode;Apple Silicon 上另有 MLX 优化版本 nemotron-3.5-lightning:30b-mlx。
NVIDIA 官方 X 把这些优化落到 PinchBench 上:模型以 86% 准确率完成 10,000 个任务,比 Qwen3.6 35B 快 35%。上文开头的图正是这张效率前沿。
路由降本 74% 成立,但没赢过纯小模型
LangChain 的实测设置:145 个多步任务、平均每任务 6.3 次模型调用,覆盖客服对话、值班排障、跨消息与工单的流程自动化。三条对照臂:单独 Opus 4.8 准确率 86.0%、每次运行 $11.45;路由方案 80.0%、$3.00;单独 Lightning 77.7%、$0.72。
钱的流向是核心发现。Lightning 处理了 93% 的调用,只占 10.4% 的花费;Opus 处理 7% 的调用,占 68.4%;负责投票的 judge 小模型占剩下 21.2%。
博客同时写明一个未决问题:路由比纯小模型只高 2.3 分,小于单次运行的 ±2.7 分波动,作者直言「we cannot say routing beat the cheap model here」(不能说路由在这里赢过纯小模型);如果流量形态接近这套评测、又只追求最低成本,单独跑 Lightning 是更好的选择。
博客还给出事前公式:minimum offload = judge cost ÷(贵模型成本 − 便宜模型成本)。两个模型价差小时,公式会要求把超过 100% 的调用转给便宜模型,路由不可能回本,除非自己本地托管便宜模型,比如在 DGX Spark 上推理成本接近零。
NVIDIA 自己的口径是内部基准:Switchyard 把任务完成成本降到约 Opus 4.8 的三分之一。
成本控制落到每一次调用
发布当天三家推理栈均已就绪,加上 enable_thinking 这类按请求推理开关和 Switchyard 路由,长期运行 agent 的成本控制从「选哪个模型」下沉到「每一步调用怎么调度」:哪一步开推理、开多长预算、哪一步转给前沿模型。
剩下的问题从「能不能跑」变成「值不值得路由」。LangChain 的公式只能排除错误答案,最终得拿自己的工作负载实测。
参考链接
- NVIDIA 官方博客(Nemotron 3.5 Lightning 与 NeMo Switchyard 发布):
- NVIDIA AI 官方 X 发布推文:
- vLLM 官方博客(Day-0 支持公告):
- vLLM 官方 X 推文:
- LMSYS Org / SGLang 官方博客(Day-0 支持公告):
- Ollama 官方博客:
- Artificial Analysis 官方 X 评测:
- LangChain 官方博客(Switchyard 路由实测):
- CNBC 报道: