AREX Feed Article
NVIDIA 在 SIGGRAPH 押注世界模型:预测物理环境的下一状态,而不是下一个 token
语言模型预测一段文本的下一个 token;世界模型预测的是物理环境的下一个状态:推一下这个物体会怎样、材料会怎么变形、一辆车以给定速度行驶最终停在哪里。8 月 17 日,用这组对比概括 NVIDIA 在洛杉矶 SIGGRAPH 2026 上的主题演讲《Next Era of Graphics — Neural Rendering, World Models, and Simulation》,并称之为 NVIDIA 对「机器人瓶颈」的押注。
演讲在 7 月 20 日下午 3:45(太平洋时间)举行,主讲人是三位 NVIDIA 研究负责人:杰出工程师 Neil Ashton、应用深度学习研究总监 Edward Liu,以及 Cosmos Lab 副总裁 Ming-Yu Liu。的记录显示,Ming-Yu Liu 当天在台上发布 Cosmos 3 Edge,一个 40 亿参数、可实时跑在设备端的世界模型;Neil Ashton 讲 AI 物理,Edward Liu 讲 3D 引导的神经渲染。
语言模型预测 token,世界模型预测「推一下会怎样」
WION 给出的定义很具体:语言模型预测文本序列的下一个 token,世界模型预测的是推一下这个物体会发生什么、材料如何变形、以给定速度行驶的车辆会停在哪儿。它是对物理现实的学习型仿真(learned simulation),而不是对语言的学习型仿真。
WION 认为这项能力正是机器人的瓶颈,也解释了机器人为什么至今远落后于聊天机器人:生成一句错误的句子没有成本,误判重量的机器人会把东西摔在地上,物理世界的后果对错误不宽容,文本则不然。
世界模型还改变了机器人的训练方式。足够接近现实的模拟环境,让机器人在接触真实硬件之前先在软件里尝试一个任务数百万次。WION 的判断是,这是唯一经济上可行的训练路径,否则这些系统会在学习过程中毁掉昂贵的设备。
NVIDIA 官方博客的表述一致:物理 AI 系统依靠世界模型感知、推理并预测物理环境。Ming-Yu Liu 的说法是:"What makes a foundation model a foundation model is its capability to consume enormous amounts of diverse data."(基础模型之所以是基础模型,在于它能消费海量多样数据)
Ming-Yu Liu 介绍,Cosmos 用涵盖世界理解、预测、仿真和动作的物理任务数据训练,"We use one backbone to solve all the different tasks."(我们用同一个主干解决所有任务)
不同机器人说不同的话:"Every embodiment speaks a different language."(每种具身说不同的语言)NVIDIA 的解法是 "build a common vocabulary"(建立一套共同词汇)。
具体实现是 mixture-of-transformers 架构,它给 Cosmos 3 全局理解能力,让同一模型应对人形机器人、机械爪、自动驾驶汽车等不同具身。
Cosmos 3 Edge:40 亿参数,实时跑在端侧
主题演讲当天发布的 Cosmos 3 Edge 是 40 亿参数的世界模型,NVIDIA 称它专为设备端实时运行设计,针对 Jetson、RTX PRO、DGX 和 GeForce RTX GPU 做了内存效率与吞吐优化。它能理解和生成文本、图像、视频、环境声与动作,官方博客称其为 omnimodel。
性能上,NVIDIA 称 Cosmos 3 Edge 在 VANTAGE-Bench 视觉分析基准上排名参数级别第一,并可通过后训练用于机器人学习。Agile Robots、Doosan Robotics、Siemens 和 Skild AI 正在评估把它用于机器人工作流,包括在 Jetson Thor 上跑实时控制策略。
在自动驾驶一侧,Cosmos 3 Edge 支持道路场景理解、交通推理、目标意图预测与策略模型蒸馏。开发者还可以在 DGX Station 上用自己的机器人与传感器数据做后训练,把得到的世界动作模型部署到 Jetson Thor。
Cosmos 3 家族分三档:Edge(4B)、Nano(16B)与 Super(64B),都已发布在 Hugging Face,推理与后训练框架在 GitHub 开源。
Ming-Yu Liu 还在演讲中发布 Cosmos-Dreams,一组闭环模拟器。现场演示是自动驾驶模拟器,从单帧画面生成整个虚拟世界,跑在一块 RTX PRO 6000 GPU 上。NVIDIA 的定位是:在真实车队部署前用它验证模型准确性,或用 AI 生成的罕见场景训练模型,加快开发并省下运营成本。
为什么说图形学研究就是机器人研究
Edward Liu 开场讲 3D 引导的神经渲染,列出三个研究难题:保留创作者意图、输出跨帧时间稳定、实时渲染 4K 内容。他说 "Control in artistic direction is a really exciting research direction for us."(艺术方向的控制是让我们兴奋的研究方向)WION 补充,Edward Liu 负责的应用深度学习研究包括 DLSS 技术套件与神经渲染。
他把 AI 与图形学的关系说成:"AI extending graphics the same way programmable shaders and ray tracing have extended graphics before."(AI 对图形学的扩展,就像当年可编程着色器与光线追踪对图形学的扩展)另一句是:"Simulation defines the world, generation enriches its appearance and artists direct the outcome."(仿真定义世界,生成丰富外观,艺术家决定结果)
WION 解释了神经渲染为什么和世界模型是一件事:神经渲染用学习到的模型生成图像,而不是逐条光线走传统渲染管线。
模拟只有在看起来和行为上都足够接近现实时,仿真里学到的技能才能迁移出来。WION 的结论是 "The graphics research and the robotics research are the same research."(图形学研究和机器人研究是同一个研究)
Neil Ashton 的部分把这条线接到工业与气候。他的 AI 物理工作覆盖天气预报、汽车空气动力学、热设计。NVIDIA Earth-2 开放模型家族让科学家用仿真数据训练的 AI 模型把模拟分辨率提上新高度,精度与传统方法相当或更高。
他给出一个具体数字:NVIDIA Research 与合作伙伴的模型架构把检查点压缩到几百 MB,约百万倍压缩,一秒内生成物理精确的可视化。Ashton 说:"The challenge that we have is to translate the success of using these AI models in weather and climate into the world that we live in, to be able to design the planes and cars and data centers of the future."(真正的挑战是把 AI 模型在天气与气候上的成功迁移到现实世界,用来设计未来的飞机、汽车和数据中心)
Jensen Huang 在开场视频里的说法是:"to create virtual worlds that behave with the fidelity and realism of the physical world."(创造行为保真度与真实感等同物理世界的虚拟世界)
对手在抢 CUDA 和算力,NVIDIA 押的是下一个约束
WION 把这笔账算得直白,NVIDIA 押的是下一个约束。NVIDIA 今天的收入来自数据中心 GPU 训练和推理语言模型,这个市场巨大且供不应求,但竞争压力也全在这里。
Qualcomm 收购 Modular 冲击 CUDA 软件护城河,AMD 拿到 OpenAI 与 Meta 的吉瓦级算力承诺,超大规模厂商自研芯片,中国实验室用低得多的成本做出前沿级模型。
物理 AI 是另一条战线,而且 7 月底形势变了。7 月 28 日, 报道美国政府以国家安全的「不可接受风险」为由,宣布禁止进口新的外国产人形机器人(覆盖人形与四足机器人),FCC 把这些设备列入 Covered List 管制清单,列出的风险包括机器人被用于监视美国人、被远程接管。
BBC 的报道还说明,禁令针对新生产的外国产机器人与电力逆变器,此前已获 FCC 授权的老型号不受影响。WION 的解读是,这实际上把 Unitree 和 AgiBot 关在美国市场门外,两家公司 2025 年合计出货占全球人形机器人大头。
市场缺口已经有人来填。Hyundai 在 2026 年 1 月 CES 上公布计划:2028 年前在佐治亚州 Savannah 附近的 Metaplant 工厂实现年产 3 万台 Atlas 人形机器人,先在厂内做零部件排序,2030 年转向组件装配,合作伙伴包括 Google DeepMind 与 NVIDIA()。
WION 的表述是,Hyundai 正与 NVIDIA、Google DeepMind 合作开发 Atlas 人形机器人,目标 2028 年在佐治亚州工厂部署。
软件侧同一周也有动作。7 月 30 日,Google DeepMind 发布 Gemini Robotics 2(),三个模型里包括 Gemini Robotics On-Device 2,可在机器人设备本地运行、不依赖云连接;据 Google DeepMind 称,用几小时数据、通常不到 200 个示例,就能适配全新的双臂机器人形态。
模拟里学会的技能,能不能带进真实世界
WION 指出一个更根本的缺口:西方机器人落后的是产量与成本,但瓶颈主要在认知而非机械。造一台能感知非结构化环境、规划任务并动手执行的机器,远比造出机器本体难。
世界模型冲着这个认知缺口去。Cosmos-Dreams 的设计用法已经写明检验标准:先在模拟里验证模型准确性,再部署到真实车队。能不能成立,取决于仿真里学到的技能能否迁移到现实,这是 NVIDIA 这一轮押注还没有答案的部分。
WION 把赌注写得清楚:如果世界模型成功,提供它们的人将在机器人领域占据 NVIDIA 目前在语言模型领域占据的位置,而 NVIDIA 正在同时建造模型和运行模型的硬件。