AREX Feed Article
NVIDIA Cosmos 3 登顶五项基准:为物理 AI 装上开源世界模型
Ming-Yu Liu 交底:世界模型如何给物理 AI 造数据
8 月 6 日,NVIDIA Cosmos 实验室 VP Ming-Yu Liu 在官方博客详解 Cosmos 3 开放世界模型的技术路线与行业采用。
Cosmos 3 是一个开放权重模型家族,采用 Linux 基金会 OpenMDW 1.1 许可证。模型今年 5 月 31 日已在 Hugging Face 和 GitHub 发布。
博客指出,物理 AI 的真实训练数据昂贵且难以规模化采集,长尾场景和罕见事件尤其难以安全复现。Cosmos 3 的解法是通过世界模型生成合成数据:同一个模型可以充当视觉语言模型理解场景,可以充当物理世界模拟器预测未来状态,也可以作为世界-动作模型的主干。
LG、三星、小米都在用,Cosmos 联盟铺到日本
博客披露了一份横跨三大领域的采用方名单。
机器人领域:Doosan Robotics、LG 电子、三星电子和 Skild AI。自动驾驶领域:Li Auto、小米和 Afari。视觉 AI 领域:Centific、Fogsphere、Linker Vision、Milestone Systems 和 Yuan。
NVIDIA 同时宣布 Cosmos 联盟已扩展至日本。当地机器人和制造业企业计划在工厂、物流、农业、建筑、医疗和交通六大场景中开发开放世界模型。
一封公开信、一个 Robotaxi 模型,铺垫了这次路线公开
7 月,NVIDIA 与超过 200 家企业共同签署「开放权重与美国 AI 领导力」公开信,主张 AI 领先地位取决于开放生态能否覆盖所有行业,而非单一前沿模型的表现。
8 月 4 日,NVIDIA 发布 Alpamayo 2 Super——一个 34B 参数的自动驾驶推理模型,基于 Cosmos 3 Super Reasoner 后训练而成。该模型在 Hugging Face 下载量已突破 50 万次,是目前该平台采用最广的自动驾驶开放推理模型系列。
从签署公开信到交付商业可用的开放模型,再到博客阐明技术路线,NVIDIA 在两个月里完成了从表态到落地的三步走。
一个 Mixture-of-Transformers 架构,三种运行模式
Cosmos 3 基于统一的 Mixture-of-Transformers 架构,自回归 Transformer 负责推理,扩散 Transformer 负责多模态生成,两者共享同一主干和 3D 多维度旋转位置编码。
模型家族包含三个规模:64B 的 Super 面向数据中心高保真世界建模与合成数据生成;16B 的 Nano 在质量与速度之间取平衡,适合后训练;4B 的 Edge 可在 NVIDIA Jetson Thor 等边缘设备上运行,面向实时机器人策略部署。
在五个基准测试中,Cosmos 3 均位列开源模型第一:Artificial Analysis 的文本到图像和图像到视频生成,PAI-Bench 的世界生成,Physics-IQ 的图像到视频类别,RoboLab 的机器人策略评估。Cosmos 3 Super 同时是 VANTAGE-Bench 视觉理解基准中排名最高的开源模型。
NVIDIA 将 Cosmos 3 与 Omniverse 仿真库和 OpenUSD 3D 资产框架打通。Omniverse 库属于 NVIDIA Agent Toolkit,提供搭建仿真环境的预置能力;OpenUSD 提供 3D 资产的组合与复用标准。
开源不是选择,是工程条件
博客写道,通用模型没见过一个团队手里的机器人、传感器和作业环境。弥合这个差距需要三样东西:模型权重、允许定制的许可证,以及配套的后训练工具。
这正是 Cosmos 3 以 OpenMDW 1.1 许可证开放的原因。团队可以在自有数据和硬件上进行后训练,将通用世界模型适配为特定机器人或车辆的专用模型。博客将此总结为:「专业化让开放成为一项实际的工程要求。」
物理 AI 的每个部署场景都是一个专业化问题——这正是博客论证开放权重必要性的逻辑起点。
世界模型正在成为物理 AI 的数据基座
Cosmos 3 的路线揭示了一个方向:物理 AI 的训练数据瓶颈,正由世界模型来填补。博客列举的 12 家采用方覆盖机器人、自动驾驶和视觉 AI 三个领域,Cosmos 联盟的跨国扩展则表明,这一方向已超越 NVIDIA 单家推动的范畴。
博客末尾指向了 Hugging Face 模型库、技术报告和 Cosmos Labs 直播等资源——开放权重之后,开放生态是下一步。