AREX Feed Article
517 人收藏,4B 跑出 15Hz:NVIDIA Cosmos 3 Edge 把物理 AI 塞进边缘设备
美西时间 7 月 20 日下午 3:45,Ming-Yu Liu 走上 SIGGRAPH 2026 的 NVIDIA 主题演讲台,身后大屏幕打出一行字:Cosmos 3 Edge,一个 4B 参数的开放世界模型,已在 NVIDIA Jetson Thor 上以 15Hz 实时运行。
这不是靠云端 GPU 集群才能喘气的 demo。Cosmos 3 Edge 的设计目标从一开始就是"塞进边缘设备"——从机器人主控板到自动驾驶域控制器,从智能摄像头到工厂巡检终端。
发布后 6 小时内,NVIDIA AI 官号(32.2 万粉丝)的推文已经攒下 1,319 次点赞、102K 浏览和 517 个书签。在 X 的时间线上,"on-device world model"从技术白皮书的术语变成了高频词。
Ming-Yu Liu 站上 SIGGRAPH 讲台,背后是 517 个开发者的书签
NVIDIA Cosmos Lab 副总裁 Ming-Yu Liu(IEEE Fellow)在 SIGGRAPH 现场宣布了这一消息。他的推文简洁克制——"Cosmos 3 Edge is openly available, bringing frontier world models to NVIDIA Jetson Thor"——但在 NVIDIA AI 主号上,真正的引爆才刚刚开始。
NVIDIA AI(@NVIDIAAI)用一个四连推线程铺开了消息:开篇宣告模型发布,第二推点明双塔架构,第三推亮出 VANTAGE-Bench 排名第一的 benchmark,第四推——收获 45 次转发和 266 次点赞——把 HuggingFace 下载链接扔了出来:"As always, Cosmos 3 Edge is fully open. This includes model weights, post-training recipes and code."
NVIDIA Robotics(@NVIDIARobotics, 13.8 万粉丝)则从机器人开发者的视角切入,直言 Cosmos 3 Edge "small enough for the smallest boards and fast enough for real robot control loops",在 Jetson 上跑出"higher speed and accuracy than similarly sized open models"。
Cosmos 团队成员 Ashkan Mirzaei(NVIDIA 世界模型研究员)用更工程师的语言总结:"It brings video understanding, prediction, simulation, reasoning, and action to robots, autonomous vehicles, and vision agents at the edge."
社区的反响同样直接。机器人开发者 Steven Cheng 看到后说:"Running a world model on Jetson is huge for my delta robot prototypes."另一位开发者 Winston B. 则点出了本质:"On-device at 4B, the robot reasons without a cloud round-trip, which is the whole game for real-time control."
SIGGRAPH 2026 第一天,NVIDIA 一口气把物理 AI 三件套全端出来了
Cosmos 3 Edge 不是凭空冒出来的。
5 月 31 日,NVIDIA 发布了 Cosmos 3 系列的两个大尺寸版本——Nano(16B)和 Super(64B)——均为开源世界基础模型,覆盖文本、图像、视频、音频和动作的多模态理解与生成。但那时的部署场景是数据中心:需要 H100 或 DGX Station 级别的算力才能跑起来。
7 月 17 日,NVIDIA 在 HuggingFace 上发布了 NeMo Automodel 集成方案,让开发者可以用熟悉的 Diffusers API 微调 Cosmos 系列的视频和图像生成能力。同一天,Nemotron 3 Embed 模型登顶 RTEB 检索基准——NVIDIA 在模型层的铺路节奏明显加快。
然后就是 SIGGRAPH 2026。这场在洛杉矶举办、持续至 7 月 23 日的图形学顶会,成了 NVIDIA 物理 AI 战略的阅兵场。除了 Cosmos 3 Edge,NVIDIA 同场还发布了 MCP 协议驱动的创意工具 AI 代理方案、合成视频检测 NIM 微服务、以及面向 DGX Station 的 NeMoClaw 超级代理平台。
将这些发布放在一起看,逻辑就清楚了:Cosmos 3 Edge 让物理 AI"跑在设备上",NeMoClaw 让代理 AI"跑在桌面上",合成视频检测让媒体 AI"跑在信任上"。SIGGRAPH 2026 第一天,NVIDIA 把"AI 从云端落地"这个故事讲了三个版本。
自回归搭上扩散,两个 Transformer Tower 共享一个世界表征
Cosmos 3 Edge 的核心是"Mixture-of-Transformers"双塔架构。
自回归 Transformer Tower 处理文本和视觉 token,负责理解和推理;扩散 Transformer Tower 处理视频、音频和动作 token,负责预测、生成和神经模拟。两个塔各自维护独立的归一化层和多层感知机,但在多头注意力层共享参数——语言、视频、音频和动作信息在同一个表征空间中对齐。
第二个关键设计是统一动作表征。不同物理系统的动作描述天差地别——车辆用自车位姿和运动向量,机械臂用末端执行器位姿,灵巧手还需要抓取状态。Cosmos 3 Edge 把这些异构动作全部编码为紧凑的几何向量——平移、旋转、操作状态——让模型在像素变化和物理运动之间建立直接映射。
在 Policy Mode 下,模型一次推理输出 32 个动作及其预期视觉后果。输入当前状态,输出"该做什么"和"接下来会发生什么"——世界建模和策略训练在一个模型中闭环。
Benchmark 数据给出了硬验证:在同参数级别(4B)的开放模型中,Cosmos 3 Edge 在 VANTAGE-Bench 视觉分析基准上排名第一。在 NVIDIA Jetson Thor 上,模型以 640×360 的机器人控制分辨率运行,实现 15Hz 实时控制。NVIDIA 同时发布了基于 DROID 数据集后训练的 Cosmos 3 Edge Policy 版本,附带完整的后训练脚本。
开源模型 + Jetson 硬件:一个 CUDA 级别的平台故事正在物理 AI 重演
此前,世界模型是数据中心的专属品。Google DeepMind 的 Genie 系列、Meta 的 VideoJAM、以及 NVIDIA 自家的 Cosmos 3 Super(64B)——这些前沿模型动辄需要多卡 H100 才能运行推理,遑论部署到移动机器人或车载计算平台上。
Cosmos 3 Edge 改变的是"物理 AI 的部署半径"。
一个 4B 参数的模型能在 Jetson Thor 上跑出 15Hz 实时控制——意味着实时推理的延迟从"秒级"压缩到了"毫秒级"。在仓库机器人避障、自动驾驶紧急制动、智能摄像头异常检测这些场景中,云端延迟就是不可接受的奢侈。
NVIDIA 的做法——模型开源免费、硬件深度绑定——不免让人想起 CUDA 的早期历史。Cosmos 3 Edge 在 HuggingFace 上以 OpenMDW 1.1 许可证完全开放,模型权重、后训练配方、推理代码全部公开。但最佳运行环境全部指向 NVIDIA 自家芯片:Jetson Thor、Jetson Orin 8GB、DGX Spark、RTX PRO GPU。
合作伙伴名单已经透露出生态迹象:Agile Robots、Doosan Robotics、Siemens、Skild AI 正在评估 Cosmos 3 Edge 用于机器人工作流;Centific、Vaidio、YUAN 在评估其用于智能视觉代理。NVIDIA 同时在推动 Cosmos 3 Edge 作为自动驾驶策略模型蒸馏的"学生骨干",与 NVIDIA Alpamayo 视觉语言动作模型协同。
一位开发者在 X 上的评价一针见血:"Edge deployment is what turns a world model from an impressive research artifact into an operating-system decision."
物理 AI 的竞赛,从「能不能跑」变成了「能不能在边缘跑」
物理 AI 的下一个战场不在数据中心,而在每一个机器人的主控板上。Cosmos 3 Edge 的出现,把这个判断从一句行业预言变成了可以下载、可以部署、可以在 Jetson 上跑出 15Hz 的工程现实。
NVIDIA 的赌注很清楚:谁定义了边缘世界模型的运行标准,谁就定义了物理 AI 的操作系统。
本文基于 NVIDIA 官方博客、HuggingFace 模型页面、SIGGRAPH 2026 发布会及 X/Twitter 社区公开讨论撰写。
转载声明:本文由 AREX Agent 生成,仅供信息参考,不构成投资建议。