AREX Feed Article
NVIDIA 交出 NeMo Gym 工具调用管线最后拼图:8 组黄金 Policy/Tool 参考公开
2026 年 8 月 7 日,NVIDIA 在 Hugging Face 上发布了 ,包含 8 组黄金 policy/tool 参考对和完整的提示历史记录。这份资产只有 36 行数据、252 KB,却是 NeMo Gym 工具调用管线从「部分开源」走向「完全可复现」的关键一步。
252 KB 的资产,补齐了 NeMo Gym 工具调用管线的最后缺口
。紧接在后的特意澄清:这不是训练集,而是复现 agent 生成行为所必需的运行时资产。
此前,NVIDIA 已经公开了 NeMo Gym 框架本身(,Apache 2.0 许可)以及。但训练数据的生成逻辑始终是一个黑箱:外部研究者可以拿到数据,却无法理解这些数据是如何被构造出来的。
本次发布的资产正好填补了这一缺口。8 组黄金参考对定义了「好的工具调用」长什么样,提示历史则记录了从 domain 选择到 policy 撰写的完整迭代过程。管线中唯一留在 NeMo Gym 源码树中的,是当前生效的 prompt 模板。那是真正驱动 agent 行为的代码。
AK 转发、Hugging Face 官方下场:社区认出了这件事的分量
AI 研究领域的知名账号 (51.6 万关注者)和 (75 万关注者)均参与了转发,将这条消息推到了更广的受众面前。原推文累计获得 37 次点赞、9 次转发和 20 次书签。对于一条纯粹的技术基础设施发布而言,这个互动量不算低。
同一天,Prime Intellect 宣布将其 RL 堆栈从单 agent 扩展到多智能体系统,获得 725 次点赞和 62 次转发。两家公司在同一天各自公开了 RL 基础设施的关键组件,至少说明了一件事:围绕 RL agent 训练的生态竞赛正在从模型层下沉到数据和工具层。
从 Nemotron-3 Ultra 到 NeMo Gym v0.4.0:NVIDIA 的数据开源路线图
NVIDIA 对 NeMo Gym 的投入在过去两个月里明显加速。6 月 4 日, 发布,带来了 70 多个新环境和 Nemotron 3 Ultra 训练数据集。7 月 1 日, 进一步扩展了 BLADE 诊断工具、可插拔沙盒和 Fireworks/Together.ai 等托管推理提供商的接入。
在这一系列迭代背后,是 NVIDIA 在 3 月 10 日通过正式阐述的开放数据策略:不仅发布模型权重,也发布训练数据、评估框架和可复现的训练配方。当时文中提到的 NeMo Gym collection 至今已收录 32 个 RL 可验证数据集,本次发布的资产是这个集合的新成员。
这份资产同时与 Nemotron 3 家族的后训练流程深度绑定。NVIDIA 此前公开的 Nemotron-RL-Agentic 系列数据集覆盖了认证、数据查询、预订服务等 838 个领域,本次公开的 8 组黄金参考对正是这些领域 policy 定义的「基准线」。
8 组黄金参考对 + 提示历史:一个 36 行、252KB 的「配方本」
这份资产的结构很精简,但每一部分都有明确的职责。
golden_policies 目录包含 8 组 policy/tool 参考对。每组由一份 Markdown 格式的 policy 文档和配套的工具定义组成。Policy 不是对业务的描述,而是对 agent 行为的严格约束:包括对象定义、操作限制和升级规则。例如,一条航空领域的 policy 会明确规范预订变更条件、座位调整限制和行李政策边界。
工具定义则规定了 agent 可以调用哪些函数、参数是什么。这与训练数据中 agent 实际执行的工具调用形成了「参考答案」。policy 描述应有的行为,tool 定义可用的操作,两者的配对构成了评估 agent 行为正确性的基准。
prompt_history 目录记录了 policy/tool 生成提示的迭代历史,以及 domain 生成提示的版本演进。这些历史文件不参与运行时执行,但为研究者提供了理解合成数据生成逻辑的窗口。提示词本身经过了哪些修改、为什么修改,都可以追溯。
关键区别在于:这 36 行资产不是训练数据,而是数据生成器的「说明书」。170,320 条训练轨迹正是用这套说明书,通过 DeepSeek-R1-0528、Qwen3-235B 等模型合成出来的。
当管线完全可复现:RL for tool-use 的训练门槛正在降低
在此次发布之前,外部团队使用 NeMo Gym 进行对话工具调用训练的路径是断裂的。框架是开源的,训练数据是公开的,但数据的「质量标准」—— 也就是用来判断生成质量好坏的参考 —— 掌握在 NVIDIA 手中。研究者可以 fork 代码、下载数据,但无法自行生成质量可控的新数据。
现在这条路通了。有了黄金参考对和生成提示模板,任何人都可以复现 NVIDIA 的数据合成流程,并在此基础上针对自己的领域定制 policy 和工具定义。NeMo Gym 的生态系统已经集成了 VeRL、Unsloth 和 TRL 等主流 RL 训练框架,从数据生成到模型训练的完整链路被打通。
从 Nemotron 3 Nano(4B 参数)到 Ultra(550B 总参数 / 55B 激活参数),NVIDIA 的模型家族都受益于这一管线。公开资产意味着,未来任何团队都可以在自己的垂直场景里跑通同样的流程:定义 policy → 生成工具 → 合成对话 → RL 训练 → 部署 agent。
拼图完整,但配方本身才是最难复制的部分
资产公开不等于门槛消失。8 组黄金参考对为开发者提供了可直接借鉴的 policy 样板,但 838 个 domain 的大部分仍然没有公开的参考标准。NVIDIA 选择性地公开了其中的 8 组,相当于给出了示范而非全貌。
真正的瓶颈在于:高质量的 policy 需要领域专家对业务约束的精确表达,而这不是靠扩大模型规模能解决的。共享黄金参考降低了复现门槛,但「定义什么是好的工具调用」这件事本身,仍然需要人类专家坐下来写清楚一行行规则。
NeMo Gym conversational tool-use 管线的最后一块拼图已经就位。从框架到数据再到质量标准,NVIDIA 把训练一个能调用工具的 RL agent 所需的全部组件摆到了明面上。剩下的事情是:有没有人愿意坐下来,为自己所在的领域写一份足够好的 policy。