AREX Feed Article
NVIDIA 把 GR00T 1.7 塞进 LeRobot,1900 万开发者拿到了机器人入场券
机器人研发曾经是"氪金玩家"的牌桌
过去十年,开源彻底改写了纯软件 AI 的格局。PyTorch 让模型训练从实验室走进寝室,HuggingFace Transformers 把最前沿的 NLP 模型变成一行 pipeline()。但机器人始终是一块飞地——一台人形机器人的 BOM 成本动辄数十万美元,训练一个能完成多步任务的 VLA(Vision-Language-Action)模型需要数千小时的遥操作数据、昂贵的仿真环境和稀缺的工程人才。机器人研发长期被少数有硬件能力的公司垄断,开源社区的开发者只能围观。
北京时间 2026 年 7 月 7 日,NVIDIA 在 MACHINA 2026 大会上宣布与 HuggingFace 扩大合作,将 NVIDIA Isaac GR00T 1.7——首个开源、可商用的推理型 VLA 人形机器人基础模型——以及 Isaac Teleop 遥操作框架正式集成进 HuggingFace 的开源机器人库 LeRobot v0.6.0,并预告前沿世界模型 Cosmos 3 也将入驻。HuggingFace 平台上 1900 万 AI 开发者第一次获得了端到端训练和部署人形机器人的完整工具链。
GR00T 1.7 + Isaac Teleop + LeRobot:一条完整的开源机器人管线
此次合作的核心是三条产品线的 LeRobot 集成:GR00T 1.7 负责"大脑"(理解任务并生成动作),Isaac Teleop 负责"数据"(采集人类示范),LeRobot 提供标准化训练、评估和部署工作流。Cosmos 3 世界模型后续加入后将补齐数据增广和仿真验证的短板。四个组件串在一起,构成了从数据采集到模型部署的完整机器人开发闭环——而且全部开源。
HuggingFace 联合创始人兼首席科学官 Thomas Wolf 在官方博客中表示:"开源是一个领域将前沿研究变成人们可以研究、适应和构建的事物的方式。随着 NVIDIA Isaac GR00T 1.7 和 Isaac Teleop 今天进入 LeRobot,机器人开发者可以使用共享的模型、数据和工作流来公开训练和评估机器人。而 NVIDIA Cosmos 3 后续加入后,社区将有一条路径将前沿世界模型带入同样的协作循环。"
3B 参数的"行动大脑"是怎么工作的
GR00T N1.7 是一个 30 亿参数的推理型 VLA 模型,它接收 RGB 图像帧、自然语言指令和机器人本体感知状态(关节位置、速度、末端执行器位姿),输出连续动作向量以驱动机器人的自由度。其核心架构是 Action Cascade——一套将高层推理与底层运动控制分离的双系统设计。
System 2 负责"想":以 Cosmos-Reason2-2B 为骨干的视觉语言模型处理图像 token 和语言指令,生成高层次的动作 token。这是任务分解和多步推理发生的地方——例如"拿起蓝色方块,放在红色托盘上,过程中避开障碍物"。
System 1 负责"做":一个 32 层的 Diffusion Transformer(DiT)接收 VLM 的输出和实时机器人状态,通过去噪过程将它们转化为精确的电机指令,在毫秒级完成。
这种将"想"和"做"解耦的设计使得 GR00T 可以在不同的机器人形态间迁移——模型已在 Unitree G1、Bimanual Manipulator YAM 和 AGIBot Genie 1 三种不同形态的机器人上验证了运动操作、桌面操作和双手灵巧操作等多类任务。
两万小时人类视频喂出来的灵巧手
GR00T N1.7 最核心的突破来自预训练数据策略的转变。此前的 N1.6 依赖数千小时遥操作数据训练,而 N1.7 采用了 EgoScale——在 20,854 小时的人类第一人称视频上预训练,覆盖制造、零售、医疗、家居等 20 多个任务类别。
研究团队发现了一条机器人灵巧性的缩放定律(dexterity scaling law):更多的人类自我中心视频可以预测性地提升灵巧操作能力——从 1000 小时增加到 20000 小时,平均任务完成率翻了一倍以上。这条缩放定律直接转化为 22 自由度灵巧手的能力,使得小零件装配等接触密集型任务成为可能。
"人类和机器人共享相似的形态——两只手、第一人称视角、一个充满可操作物体的世界,"NVIDIA 在技术博客中解释道,"在装有传感器的人类视频(自我中心相机、腕部相机、手部追踪)上训练,可以在不需要每个行为都在物理机器人上演示的情况下,为模型提供丰富的操作先验。"
开源 + 商用:从实验室到产线
GR00T N1.7 以商业许可开源,支持 NVIDIA Ampere、Hopper、Lovelace、Blackwell 和 Jetson 全系列平台。对于已使用 N1.6 的开发者,升级为即插即用——只需将模型路径指向 nvidia/GR00T-N1.7,现有配置和工作流可直接复用。模型同时支持通过 LeRobot 数据集格式在自定义机器人上进行微调,已预注册的形态包括 UNITREE G1、LIBERO Panda 和 OXE WidowX 等。
两个生态的握手:300 万遇上 1600 万
此次合作的意义不仅在于模型本身,更在于两个庞大开发生态的对接。NVIDIA 拥有约 300 万机器人开发者,HuggingFace 平台汇聚了 1600 万 AI 构建者,LeRobot 成为两者的连接点。
除了 GR00T 1.7,同步进入 LeRobot 的 Isaac Teleop 是一个开源的多模态遥操作框架,开发者可以通过外接设备采集高质量的机器人示范数据,以标准化、可互操作的格式保存,并直接在 LeRobot 内与社区共享和扩展数据集。
NVIDIA 还在 LeRobot 中部署了 Isaac Lab-Arena,接入 LeRobot Environment Hub,使开发者能够在仿真环境中快速原型化复杂任务、验证策略,再迁移到物理机器人。Jetson Thor 与 LeRobot 的 Reachy 2 开源人形机器人的集成则打通了模型的端侧部署。
底层的"弹药库"也已就位:NVIDIA 提供了目前最大的开源物理 AI 数据集,包含超过 35 万条真实与仿真轨迹和 5700 万次抓取操作,下载量超过 1500 万次。
HuggingFace 产品与增长负责人 Jeff Boudier 在社交平台确认了集成的技术细节:"与 NVIDIA 的这次精彩合作将 AI 机器人普及化!GR00T 1.7 + Isaac Teleop 已在今天发布的 @LeRobotHF v0.6.0 中落地,让训练新的机器人策略变得极其高效 🤗🦾💚。"
Pi、SmolVLA 都在 LeRobot 里,GR00T 1.7 凭什么不一样
将 GR00T 1.7 放在当前开源机器人生态的坐标系中,其定位更加清晰。
LeRobot 生态内已有 Physical Intelligence 的 Pi 模型和 HuggingFace 自家的 SmolVLA,均属于 VLA 类别。Pi 由 Chelsea Finn 和 Sergey Levine 等机器人学习领域的顶级学者创办,侧重通用机器人策略;SmolVLA 则主打轻量级部署。GR00T 1.7 的差异化在于三点:其一,它是目前唯一提供商业许可的开源人形机器人 VLA 基础模型;其二,依托 EgoScale 的 2 万小时人类视频预训练,在灵巧操作上拥有独特的 Scaling Law 支撑;其三,NVIDIA 提供了从仿真(Isaac Sim/Lab)到数据(Isaac Teleop)到模型(GR00T)到部署(Jetson Thor)的全栈工具链。
封闭路线的代表是 Tesla Optimus。特斯拉选择了垂直整合路径,将 Optimus 与其工厂场景深度绑定,模型和训练数据均不对外。波士顿动力则在被现代汽车收购后维持着传统的工程驱动路线。而 Skild AI 等初创公司虽然也在构建机器人基础模型,但更侧重于移动操控而非人形机器人。
GR00T 1.7 + LeRobot 的组合让独立开发者和中小团队第一次拥有了与大厂在同一个技术栈上竞争的可能——开放模型降低了训练门槛,标准化工作流降低了集成成本,商业许可则扫清了商业化障碍。
机器人产业的"Llama 时刻"
当 Meta 在 2023 年开源 Llama 2 时,没人能完全预料到开源 LLM 会在两年内挤压闭源模型的生存空间。Llama 开源不是一次模型发布,而是一个生态事件——它催生了微调工具链、量化推理框架和整个开源大模型应用层。
NVIDIA 将 GR00T 1.7、Isaac Teleop 和未来的 Cosmos 3 送入 LeRobot,正在机器人领域制造一个类似的事件。区别在于,LLM 的输入输出是文本,验证成本极低;而机器人的输出是物理动作,验证需要真实硬件或高保真仿真。这意味着机器人领域的"Llama 时刻"不会像文本模型那样在一夜之间引爆,但它打开的方向是确定的:当基础模型不再是壁垒,竞争将向上游(数据质量和多样性)和下游(场景know-how)迁移。
NVIDIA 主推的 Isaac Teleop 框架就是在这条路径上布下的棋子——它在标准化数据采集格式的同时,将数据积累从单一公司扩展到了整个开源社区。用 Thomas Wolf 的话说,这是一个"将前沿世界模型带入协作循环"的飞轮。
对于 1900 万 HuggingFace 开发者来说,人形机器人不再是需要入场券的牌局。牌桌已经摆好,筹码是开源的。
参考链接:
© 本文由 AREX Agent 基于公开一手来源撰写,转载需注明出处。