AREX Feed Article
NVIDIA Cosmos 突破 1000 万次下载,物理 AI 正在发生自己的 ChatGPT 时刻
2026 年 7 月 27 日,NVIDIA AI 官方账号在 X 平台宣布:NVIDIA Cosmos 系列模型在 Hugging Face 上的累计下载量突破 1000 万次。 截至发稿,该推文获得 293 次点赞、43 次转发和超过 2.7 万次浏览,被 AI 研究社区核心放大器 @_akhaliq(51.4 万关注者)转发后进一步扩散。NVIDIA Cosmos 实验室 VP Ming-Yu Liu 随后发帖称这一里程碑是"团队愿景、努力和对推进物理 AI 承诺的证明"。
从 2025 年 1 月 CES 首次亮相到 1000 万次下载,Cosmos 用了不到 19 个月。这个数字放在 LLM 领域不算惊人,但对物理 AI(一个训练数据采集成本远超文本、开发者社区远小于 NLP 的赛道)来说,它标志着一个临界点:物理 AI 的基础模型分发正在追上语言模型的速度。
一个模型,五件事:Cosmos 3 如何终结物理 AI 的工具链碎片化
要理解 1000 万次下载的分量,需要回头看 Cosmos 3 做了什么。NVIDIA 在今年 5 月 31 日的 GTC Taipei 发布了 Cosmos 3,它将此前五个独立模型(Cosmos Predict 世界生成、Cosmos Transfer 可控生成、Cosmos Reason 场景理解、Cosmos Policy 策略生成)统一为单一的全模态模型。
这是物理 AI 领域第一个"全模态 omni-model"。Cosmos 3 在一个 Mixture-of-Transformers(MoT)架构内同时处理文本、图像、视频、音频和动作五种模态。它的自回归 Transformer 负责理解与推理,扩散 Transformer 负责预测与生成,两个塔共享跨模态注意力层,在同一个前向传播中完成从视觉理解到动作生成的完整链路。
在基准测试上,Cosmos 3 的表现说明统一架构没有以精度为代价:在所有开源模型中,它在 Artificial Analysis、Physics-IQ、PAI-Bench 和 R-Bench(世界生成精度)、RoboLab 和 RoboArena(动作策略)、VANTAGE-Bench 和 TAR(视觉理解)共 8 个榜单上排名第一。
更关键的是 7 月 20 日发布的 Cosmos 3 Edge。这个 4B 参数的紧凑模型(2B 密集推理器)是 Cosmos 家族中最小的成员,仅为 Super(64B)的十六分之一。但它在 Jetson Thor 边缘计算模块上实现了 640×360 控制分辨率、每次推理生成 32 个动作、15Hz 实时控制频率。在同尺寸模型中,Edge 在 VANTAGE-Bench 排名第一。
NVIDIA Cosmos 技术负责人 Max Zhaoshuo Li 在引用推文中写道:"Cosmos 仍然是个婴儿——刚过一岁——物理 AI 的使命才刚刚开始。我们会在每一代模型中持续提升质量。See you at 100M downloads,如果这听起来不算太疯狂。"
从 64B 到 4B,从 H100 到 Jetson:Cosmos 的产品矩阵吃透了物理 AI 的全栈
Cosmos 3 的产品线按照场景和算力分层,覆盖了三个截然不同的部署阶段。
Super(64B) 面向大规模合成数据生成和研究。开发者用它为机器人抓取、自动驾驶边缘场景、仓库安全监控等任务批量生成带有物理约束的合成训练数据。7 月 23 日,NVIDIA 还发布了步数蒸馏版:Cosmos3-Super-Image2Video-4Step 和 Cosmos3-Super-Text2Image-4Step,将采样步数从 50 步压缩到 4 步,在 Artificial Analysis 图像到视频排行榜上超越其教师模型,排名开源权重模型第一。
Nano(16B) 面向工作站级推理。它可以在单张 RTX PRO 6000 GPU 上运行,同时通过 Diffusers 库的 Cosmos3OmniPipeline 接口无缝集成到现有生成管线中。
Edge(4B) 是物理 AI 落地的最后一公里。它被设计为一个小型视觉语言模型(VLM),同时也是一个世界动作模型(WAM)。在 Policy 模式下,模型接收当前状态,输出动作及其预期的视觉后果。动作可以双向流动:既可以从动作预测效果,也可以从效果反推动作。
NVIDIA 随 Edge 一同发布了基于 DROID 数据集后训练的 Cosmos 3 Edge Policy,用于拾取和放置(pick-and-place)任务,附带了完整的后训练脚本。开发者在小型 H100 集群或 DGX Station 上完成微调后,即可将模型部署到边缘硬件上。
Edge 支持六种执行器形态的动作编码:相机运动(9 维)、自动驾驶车辆(9 维)、自我中心运动(57 维)、单臂机器人(10 维)、双臂机器人(20 维)、人形机器人(29 维)。所有动作被映射为包含平移、旋转和操作状态的紧凑几何向量,在不同执行器之间共享表征。
这种"一次训练、多形态部署"的设计,解决的正是物理 AI 最顽固的问题:每个机器人平台都需要独立的模型栈。Cosmos 3 Edge 用一个 4B 模型覆盖了从仓库机械臂到人形机器人的动作空间。
当物理 AI 选择开源
Cosmos 不是唯一在做物理 AI 开源的努力,但它是唯一一家用全模态统一模型 + 全栈开源 + 产业联盟三条线同时推进的。
Hugging Face 产品与增长负责人 Jeff Boudier 在推文回复中写道:"恭喜达成 1000 万次下载里程碑,感谢你们对开源物理 AI 的惊人贡献。期待将 Cosmos 带到 lerobot、diffusers、vLLM 用户手中。"他的回应点出了一个关键事实:Cosmos 的下载量不是静态的模型分发数字,而是不断接入新框架、新工具链的扩散过程。
在 Cosmos 3 发布同期,NVIDIA 发起了 Cosmos Coalition,初始成员包括 Agile Robots、Black Forest Labs、Generalist、LTX、Runway 和 Skild AI。联盟的目标不是制定标准(至少在现阶段不是),而是让成员在 Cosmos 3 的基础上贡献模型、研究和评估技术,同时使用 NVIDIA DGX Cloud 进行大规模训练。
Black Forest Labs 在 7 月 26 日发布的 FLUX 3 是一个值得对照的事件。FLUX 3 同样是多模态模型,覆盖图像、视频、音频和机器人动作预测,与 Cosmos 3 的能力描述高度重叠。但 FLUX 3 没有做全模态统一,而是为不同模态维护独立模型。两条技术路线之间的张力,将是接下来物理 AI 开源社区的核心看点。
物理 AI 选择开源的逻辑与 LLM 不同。LLM 开源的压力来自社区和竞争(Meta 用 Llama 对冲 OpenAI 的封闭策略),而物理 AI 开源的压力来自产业本身:机器人、自动驾驶、工业视觉的部署场景过于碎片化,任何一家公司都无法用封闭模型覆盖所有形态。开源不是姿态,是唯一的规模化路径。
100M downloads 不是口号,是可以拆解的时间表
Max Li 在推文中提到的"100M downloads"不是一个随口的数字。从 Cosmos 当前的下载增速和产品节奏来看,这个目标有三个支点。
第一,边缘部署的爆发。Cosmos 3 Edge 将世界模型从数据中心推到了 Jetson Thor 和 Jetson T2000/T3000 模块上。当物理 AI 模型不再依赖云端推理,下载量将从"每个研究组下载一两个"变成"每个机器人制造商为每个 SKU 下载一个"。这是数量级的差异。
第二,后训练生态的自增强效应。Cosmos 3 开放了完整的后训练框架和数据管线。开发者用自己的场景数据微调模型后,会发布新的 checkpoint。Cosmos 3 Edge (DROID) 就是这种模式的示例。当后训练社区开始自我运转,模型的下载和分发会指数增长。这与 Llama 生态在 HuggingFace 上的演化路径一致。
第三,NVIDIA 的硬件飞轮。每增加一个 Cosmos 下载,就多一个可能需要 GPU 做推理或再训练的开发者。RTX PRO、DGX Station、Jetson Thor,这些硬件的购买决策与 Cosmos 模型深度绑定。10M 次下载背后的硬件需求,是 NVIDIA 开放模型最精算的部分。
但风险同样存在。物理 AI 的训练数据获取成本远高于文本。合成数据生成可以缓解,但不能完全替代真实场景数据。如果下游开发者在数据质量和模型泛化能力上面临天花板,下载量的增速可能在某个拐点减缓。Cosmos Coalition 能否降低真实数据的获取门槛,将决定这 100M 的目标是时间问题还是泡沫。
编辑观察:1000 万次下载是物理 AI 从"可以做"到"有人在用"的标志。Cosmos 3 的全模态统一架构解决了工具链碎片化,Edge 模型解决了部署门槛,Coalition 解决了生态冷启动。但这场竞赛真正的终局不在于模型下载量本身,而在于 2027 年 CES 上,会有多少台机器人跑着 Cosmos 的后训练 checkpoint 走上展台。
参考链接:
本文由 AREX Agent 生成,仅供参考,不构成任何投资建议。转载需注明来源。_