AREX Feed Article
NVIDIA 官宣 Nemotron 3.5 Lightning:为常驻智能体加速的紧凑开源模型
NVIDIA 官方 X 账号 8 月 28 日(UTC 时间 18 时,北京时间次日凌晨)发文,正式宣布开源模型 Nemotron 3.5 Lightning,官方定位是"紧凑、可定制"的开放模型,用来帮助常驻智能体(always-on agents)更快完成专门任务。推文用一句口号概括卖点:"Lightning fast to customize. Lightning fast to run."(定制快如闪电,运行快如闪电)。
随推文发布的还有一段视频:Kari Briski 做客 MTSlive(@MTSlive),讲解 Lightning 如何让常驻智能体工作得更快。这不是模型第一次出现在公众视野——8 月 11 日 NVIDIA 技术博客已披露模型细节:30B 参数的混合专家(MoE)模型,每个 token 只激活 3B 参数,面向高吞吐、低延迟的智能体执行任务。
官宣口径:定制快、运行快
推文正文很简短:两句口号,一句定位,一句视频导语,末尾附 。NVIDIA 在推文中称,Nemotron 3.5 Lightning 是"紧凑、可定制的开源模型,旨在帮助常驻智能体更快完成专门任务"。
视频中出镜的 Kari Briski,其 X 主页简介自称"VP Enterprise software, models, and services"(企业软件、模型与服务副总裁)。 她做客的 MTSlive 是 X 上一个发布 AI 访谈视频的账号,简介自称"Chronicling the singularity",关注者约 46.7 万。
截至 8 月 29 日,这条官宣推文已累计约 8 万次浏览、300 余次点赞。需要提醒的是:目前关于模型规格与性能的全部描述都来自 NVIDIA 官方口径,未经独立验证。
30B 参数里只有 3B 在跑
Nemotron 3.5 Lightning 采用 MoE 架构:路由机制把每个 token 只分给少数专家,一次计算只动用全部参数的一小部分。NVIDIA 技术博客的解释是,这让模型拥有接近更大稠密模型的容量,算力成本却接近小模型。
它在 Nemotron 3 家族中是最小的一员,定位是常驻智能体的"执行层"。NVIDIA 的论点是:长期运行的智能体把大部分时间花在高吞吐执行上——工具调用、结果校验、子智能体委派,如果每一步执行都调用前沿推理模型,成本高、延迟高。Lightning 正是为这一层设计,官方称其适配 OpenClaw、Hermes Agent 等智能体框架,并有 NemoClaw 开源管理与安全栈配套。
部署范围从桌面 DGX Spark 一直到数据中心,也可在 RTX PC、DGX Station、Jetson 上本地运行,同时支持 LM Studio、llama.cpp、Ollama、Unsloth 等常用推理工具。和历次 Nemotron 发布一样,权重、训练数据和配方按 OpenMDW-1.1 许可开放:可从 Hugging Face、ModelScope 下载,在 build.nvidia.com、OpenRouter 上试用,或通过 NIM 微服务接入。
速度从哪来:投机解码与 NVFP4 量化
"运行快"被 NVIDIA 拆成了训练和推理两端的安排。训练阶段就把多 token 预测(MTP)做进模型,让模型一次草拟多个 token;推理时再配 DFlash、DSpark 两个草稿模型做投机解码,由主模型批量校验。官方称,这套组合让 Lightning 的输出速度最高达到同类模型的 4 倍。
另一个加速点是量化。除 BF16 权重外,NVIDIA 同时提供 NVFP4 量化版本,使用与 Nemotron 3 Ultra 相同的专用内核,覆盖 Blackwell、Hopper、Ampere 三代 GPU,同一份文件在数据中心和桌面 DGX Spark 上通用。
性能数字也全部来自官方口径:NVIDIA 称该模型在 Artificial Analysis Intelligence Index 上定义了小开源模型的精度-速度 Pareto 前沿;在 PinchBench 上以 86% 的准确率完成 10,000 个任务,比 Qwen3.6 35B 快 30% 且精度相当。这些数字均出自 NVIDIA 的声明,未经独立验证。
开箱即定制,从 LoRA 到 Switchyard
"定制快"对应一套开箱即用的工具链:用 NeMo Automodel 和 NeMo Megatron Bridge 做 LoRA 或全参数 SFT,用 NeMo RL 和 NeMo Gym 做强化学习与环境评估。本次发布还附带开源数据集 Nemotron-RL Agentic Terminal Pivot,用于训练编码智能体能力。模型小,微调门槛就低,这正是"Lightning fast to customize"的直接含义。
与模型一同推出的还有开源路由库 NeMo Switchyard:它把请求自动分派给最合适的模型,规划类请求上送到前沿模型,执行类请求下放到 Lightning,开发者无需改写应用。NVIDIA 内部基准称,用 Switchyard 路由后,任务完成成本降至单用 Opus 4.8 的约三分之一。
NVIDIA 还称,CrowdStrike(网络安全)、Harvey 与 Trajectory(法律)、CodeRabbit 与 Baseten(代码审查)、Lila Sciences(生命科学)、Fastino Labs(软件、金融与医疗)等团队已用 Lightning 做领域定制;模型开发获得了 Nemotron Coalition 成员在评估方法、推理软件和数据集上的贡献。
常驻智能体为什么需要"模型系统"
这次官宣背后是 NVIDIA 对智能体架构的判断:AI 正从聊天机器人转向自主智能体,常驻智能体越来越多地由"模型系统"组成——一个前沿推理模型负责规划与编排,多个小模型负责具体执行。Nemotron 3.5 Lightning 是执行层这块拼图,也是 Nemotron 3 家族继 Nano 之后的又一次扩展,把开源模型的产品线进一步拉长。
这套叙事能否成立,取决于官方数字能否被复现。好在模型权重、数据、配方全开放,任何团队都能下载、微调、自己跑分。官方公布的速度与精度数字是否站得住,现在轮到开发者来复测。