AREX Feed Article
NVIDIA 甩出 Nemotron Lightning + Switchyard:agent 快 30%,成本砍到三分之一
8 月 11 日,NVIDIA 正式发布 Nemotron 3.5 Lightning,一个 30B 参数的混合专家(MoE)开源模型,每次推理仅激活 3B 参数,专为长期运行的 AI agent 高频执行层设计。同场发布的还有 NeMo Switchyard,一个开源的模型路由库,能自动将 agent 工作流每一步分派到最合适的模型。NVIDIA 内部基准显示,Switchyard 在维持前沿精度的同时,把任务完成成本压到仅使用 Opus 4.8 的约三分之一。
黄仁勋在 X 上用一行字给发布定了调:「Smart, fast, efficient and open.」,。
黄仁勋用四个词定调,OpenRouter 当天上线
称:「Lightning strikes for continuous and long-run agents! Nemotron 3.5 Lightning is smart, fast, efficient and open.」推文在数小时内获得超过 48 万次查看、4800 次点赞。
链接了由生成式 AI 副总裁 Kari Briski 执笔的,将这次发布定位于「从聊天机器人转向自主 agent」的市场节点。博客指出,当 agent 系统需要持续运行、处理大量重复性任务时,用同一个前沿模型应对所有步骤既不经济也不必要,这正是 Lightning 和 Switchyard 的组合要解决的问题。
,标注 1M token 上下文窗口,蒸馏自 Nemotron 3 Ultra。OpenRouter 页面的描述直截了当:「Built for high-volume, specialized AI agent workloads, delivering up to 4× higher throughput and up to 30% faster task completion.」
Agent 不缺「大脑」,缺的是「手脚」
AI agent 的叙事长期集中在「能不能规划」「能不能推理」「能不能用工具」。但当 agent 真的跑起来——代码审查、安全告警监控、账单问答、子任务分派,大量 token 消耗不在「思考」,而在执行:调接口、验结果、格式化输出。
NVIDIA 在博客里画出了这条分界线:一个 Nemotron 3 Ultra 或 GPT-5.6 级别的前沿模型负责规划和编排,而 Nemotron 3.5 Lightning 这类轻量专用模型处理高频执行。按 NVIDIA 的说法,这是「a system of models」,不是「one model to rule them all」。
Nemotron 3.5 Lightning 紧随今年早些时候发布的 Nemotron 3 Nano,是 Nemotron 3 家族中最小但最高效的成员。它由 Nemotron Coalition 成员贡献评估方法、推理软件和数据集共同推进,发布时附带了两个开源强化学习数据集:Nemotron-RL-Agentic-Terminal-Pivot(面向 agent 代码环境)和 Nemotron-RL-Lighting-Training-Blend(在 Nemotron Ultra 数据基础上扩展的 RL 混合数据)。
4 倍输出速度,靠什么做到
Nemotron 3.5 Lightning 的 30B 总参数中每次只有 3B 被激活。MoE 路由器将每个 token 仅发送给少数专家,从而在保持大模型容量的同时将计算成本压到小模型水平。
速度提升来自三个层面。首先是 Speculative Decoding:模型在预训练阶段内置了多 token 预测(MTP),并额外提供了 DSpark(推荐用于 DGX Spark 和低并发数据中心)和 DFlash 两个草案模型,使推理时单步可生成多个候选 token 再统一验证。其次是量化:同时发布 NVFP4 和 BF16 两个检查点,NVFP4 可在 Blackwell、Hopper 和 Ampere 架构 GPU 上运行,从桌面 DGX Spark 到数据中心同一套权重文件。
在 Artificial Analysis Intelligence Index(综合 9 项评估覆盖 agent 任务、编程、科学推理和通用智能)上,Nemotron 3.5 Lightning 占据了同等规模开源模型的精度-速度 Pareto 前沿。在 PinchBench 基准中,该模型以 86% 的准确率完成 10,000 个任务,比同等精度的 Qwen3.6 35B 快了 30%()。
十个伙伴同日接入,Switchyard 把每个前沿模型变成「可选项」
NeMo Switchyard 是这次发布中被低估的一半。它是一个开源模型路由库,嵌入 agent 工具链后,能根据质量、延迟和成本需求自动将每个请求路由到最适合的模型,不需要开发者重写应用。
NVIDIA 内部基准中,Switchyard 最狠的数字是这个:维护前沿级精度的同时,任务完成成本降至仅使用 Opus 4.8 的三分之一。
当天宣布接入或评估 Switchyard 的合作伙伴名单:
- LangChain 在 145 个多轮 Deep Agents 任务中,只将 7% 的调用路由到前沿模型,成本降低 74%,精度仅牺牲 6%。
- Ramp 在 SWE-Bench 上匹配了前沿模型性能,同时成本砍掉 58%、运行时间减少 33%。
- Cognition 将 Switchyard 的分阶段路由器集成进 Devin Desktop,在 FrontierCode Main 上实现接近前沿的性能,平均成本降低 28%。
- Boomi 在五项路由能力评估中实现 100% 领域路由准确率,59% 流量被导向快 5 倍的微调模型,后期轮次延迟降低 21%。
- Cadence 通过 ChipStack AI Super Agent 在形式化验证场景中效率提升 9.9%。
- Classmethod 内部测试显示 27% 成本降低且质量不降。
- Kong 通过 Kong AI Gateway 原生交付 Switchyard 路由。
- LiteLLM 将 Switchyard 作为插件加入代理层,开发者无需更换现有技术栈。
- Nous Research 将 Switchyard 集成进 Hermes。
- Siemens 正在其 Fuse EDA AI Agent 中基准测试。
在模型定制一侧,CrowdStrike(网络安全)、Harvey 联合 TrajectoryLabs(法律服务)、CodeRabbitAI 联合 Baseten(代码审查)、Lila Sciences(物理与生命科学推理)以及 Fastino AI(软件开发、金融、医疗)已在使用或定制 Nemotron 3.5 Lightning。
模型权重全开、数据全开,部署从 Jetson 到数据中心
Nemotron 3.5 Lightning 采用 OpenMDW-1.1 许可证,权重、训练数据和配方全部放出。模型可在 NVIDIA RTX PC、DGX Spark、DGX Station、Jetson 边缘设备上本地运行,也可扩展至 RTX PRO 工作站、数据中心和云端。
NVIDIA 在博客中强调,与每次 Nemotron 发布一样,在许可范围内公开了尽可能多的训练数据和技术,以便追溯、审计和训练其他模型。
一个 30B 总参数、3B 激活参数的模型,能在 Jetson 上跑 agent 执行、在 DGX Spark 上处理高频调用、在数据中心承担规模化部署。这条路线的想象力不在模型本身有多强,而在它把跑 agent 的门槛从云端集群拉到了本地硬件。