AREX Feed Article
黄仁勋东京摊牌:物理AI是下一波,日本是主战场,全栈已就位
"Physical AI is here——the next wave of AI and the foundation of the next industrial revolution."
2026年7月30日,NVIDIA官方账号在X平台发出一段不到两分钟的视频。画面里,创始人兼CEO黄仁勋(Jensen Huang)没有穿标志性的皮衣,而是一件黑色T恤。但他讲的内容,比任何一次GTC主题演讲都更具体:物理AI来了,战场在日本,全栈已经就位。
他说了三件事:Cosmos和Omniverse在虚拟世界里开发物理AI,Isaac和Newton让机器人在物理模拟的"健身房"里学习技能,Jetson机器人计算机负责运行这些智能。然后他给出了落脚点:"Together with Japan's robotics and manufacturing leaders, NVIDIA is creating a new era of industrial automation."
这条推文发布12小时内获得478次点赞、85次转发和4.3万次浏览。但对黄仁勋而言,这只是7月15日东京之行的高潮收束。
半个月前,他已经在东京下了注
7月15日,黄仁勋亲赴东京。这不是一次礼节性拜访。他身后是日本政府投入的约62亿美元、14家顶级企业的联合署名,以及一个名为"Noetra"的日本主权AI计划。
7月16日,身着黑色皮夹克的黄仁勋与发那科执行长稻叶善治、安川电机社长小笠原浩、富士通和索尼高层一起出现在东京记者会上。他的发言直接了当:"The next frontier of AI is in the physical world, and this is a once-in-a-generation opportunity for Japan."
两天前,NVIDIA刚刚在洛杉矶SIGGRAPH 2026上开源了Cosmos 3 Edge,一个40亿参数的物理AI世界模型。同期发布的,还有基于Thor架构的Jetson T2000和T3000机器人计算模块。三件事靠同一根逻辑线串起来:物理AI,从训练到部署,全栈就位。
7月30日的推文,是把这条线讲给全世界听的版本。
Cosmos 3 Edge:把世界模型塞进机器人脑袋
NVIDIA在SIGGRAPH 2026上开源了Cosmos 3 Edge,一个40亿参数的开放世界模型。它的核心能力只有一条:在本地设备上完成视觉推理和机器人动作生成,不依赖云端。
黄仁勋在推文中把Cosmos列在物理AI全栈的第一环。NVIDIA新闻稿给出了更具体的解释:Cosmos 3 Edge基于Nemotron架构构建,可以帮助机器人和视觉AI智能体理解周围环境、实时推理并生成机器人动作。开发者可以在大约一天内针对特定机器人、传感器和环境做适配。
"Until now, running frontier world models for physical AI meant cloud dependency. Cosmos 3 Edge changes that equation."一位NVIDIA工程师(Utkarsh Pathrabe)在LinkedIn上写道。他点出了关键:没有云端延迟,没有API调用费用,没有每帧推理成本。
轻量到什么程度?它可以运行在NVIDIA RTX GPU、DGX系统以及Jetson边缘设备上,包括新发布的T2000和T3000模块。一个在工厂车间里搬运零件的机械臂,靠本地一块Jetson模组就能完成"看到→理解→决定怎么动"的完整闭环。
配合Cosmos 3 Edge,NVIDIA还发布了新的Metropolis库和技能,帮助开发者使用编程智能体以至少6倍的速度构建、训练和运营视觉智能系统。
这个模型的实际落地已经在推进。富士通正在牵头,联合发那科、安川电机和川崎重工,搭建一个基于NVIDIA物理AI全栈的协同控制平台。平台整合了Cosmos世界基础模型、Isaac机器人开发平台、Omniverse NuRec库和Newton物理引擎,覆盖AI模型开发、数字孪生、机器人学习、仿真到现实的迁移以及部署前验证的完整流程。
全栈逻辑:虚拟健身房→工厂车间
黄仁勋在推文里用了不到60个英文词讲完了一整套管线。但拆开来看,每一步背后都是NVIDIA多年布局的产物。
第一环:Cosmos + Omniverse,虚拟世界里的数据工厂。 训练机器人需要海量的物理交互数据,真实世界中收集这些数据的成本极高。NVIDIA的方案是用Cosmos和Omniverse在虚拟世界中生成物理AI训练数据。Cosmos负责生成符合物理规律的视觉场景,Omniverse提供可编辑、物理精确的3D世界。本周SIGGRAPH上,NVIDIA还宣布Omniverse已完全解耦并开源,Omniverse库成为智能体可调用的工具,开发者可以直接在Blender、Houdini等现有3D应用中构建仿真就绪的场景。
第二环:Isaac + Newton,让机器人在模拟重力、摩擦力和惯性的环境中学走路。 Isaac是NVIDIA的机器人开发平台,Newton是物理引擎。两者的组合相当于一个物理模拟的"健身房":机器人可以在里面反复尝试、摔倒、重来,直到学会一项技能。川崎重工正在将这套技术应用到医疗、造船、航空航天和能源领域。久保田在探索基于Cosmos的自主农业和智能农耕。Enactic在用Isaac GR00T模型精调老年护理半人形机器人。GROOVE X在Jetson上开发伴侣机器人LOVOT。
第三环:Jetson,训练好的智能跑在机器人身体里。 Cosmos 3 Edge和Jetson硬件组成了"模型+芯片"的推理层。黄仁勋在推文中说"where their intelligence runs",就是这个意思。
三环之间有一条数据飞轮:部署后的机器人在真实世界中运行时会产生新数据,这些数据被回传用于重新训练模型,模型更新后再部署到机器人。这与特斯拉Autopilot的数据闭环逻辑同构,只不过NVIDIA把它从自动驾驶扩展到了整个制造业。
推文引用区的一位用户(@MajorOcelot45)用一条长推文梳理了这套飞轮的经济逻辑:"NVIDIA不是在卖机器人里的芯片。它正在把自己定位为从开发、训练、部署到持续优化的整个机器人舰队背后的平台。"他补充了一个数据点:Morgan Stanley Research预测到2050年将有约10亿台人形机器人,而这还不包括特种机器人、无人机和其他应用。
为什么是日本?22家企业的答案
黄仁勋选了日本,不是偶然。
日本拥有全球最完整的精密制造产业链:从半导体材料(信越化学)到工业机器人"四大家族"中的三家(发那科、安川电机、川崎重工),再到汽车制造(丰田、本田)。NVIDIA擅长算力和软件模型,但缺少顶级精密机械、工业执行机构和一线制造工艺。日本的工业硬件恰好补齐了这块短板。
Cosmos联盟的名单体现了这个判断。 根据NVIDIA 7月15日的新闻稿,已有22家日本企业和机构确认加入NVIDIA Cosmos Coalition,包括索尼集团、软银、NEC、日立、本田研发、三井物产、三菱商事、Preferred Networks、Telexistence、Turing、TIER IV、TRON、Mujin、GROOVE X、Enactic、classmethod和AIRoA。
这个名单覆盖了从芯片到成品机器人的完整链路:索尼提供传感器技术,软银负责通信基础设施(正在基于NVIDIA AI Aerial推进AI-RAN),NEC和日立做工业AI和智能建筑,Preferred Networks做世界模型研发,Telexistence做零售自动化。
日本政府的投入不是小数目。 新浪财经的深度报道给出了细节:日本政府投入约62亿美元,联合14家企业搭建AI主体整合供应链,计划2028年在东京设立专属运算基地。这是日本史上规模最大的AI基础设施项目,也是日本政府主导的、以实体AI为核心的首个国家级基建项目。
Noetra是这个计划的核心:一个由日本政府出资、NVIDIA提供芯片和软件框架的制造业本土多模态大模型。与通用生成式大模型不同,Noetra专门面向工厂自动化、物流机器人和精密制造场景训练,目标是降低日本企业对海外通用大模型的依赖,构建"工业主权AI"。
联盟背后还有一段历史伏笔。 1990年代,NVIDIA曾依靠与世嘉(SEGA)游戏机业务的合作拿到500万美元关键资金,才有后续的持续扩张。黄仁勋多次在东京演讲时提起这段往事:"如果没有当年的世嘉,就不会有今天的NVIDIA。"这一次,他带回来的不是感谢,而是一张覆盖日本制造业半壁江山的物理AI施工图。
推文引用区的一位用户(@Tr32com)的评论抓住了联盟的本质:"NVIDIA提供智能栈,日本提供物理系统——精密制造、传感器、执行器、工业机器人、工厂、维护网络和真实客户。这个组合之所以重要,是因为物理AI不会由最好的模型单独赢下。它将被那些能够大规模训练、测试、维修和部署机器的力量所赢下。"
Jetson T2000/T3000:机器人的"午餐盒超级计算机"
推文里黄仁勋提到了Jetson,但更详细的数据来自同期SIGGRAPH 2026的发布。
NVIDIA基于Thor架构推出了两款新模块。Jetson T2000:400 FP4 TFLOPS,16GB内存,40W功耗,定位为Thor架构的入门级产品,适合成本敏感的边缘设备。Jetson T3000:865 FP4 TFLOPS,70W功耗,尺寸约为T5000的一半,性能却接近,定位为中高端机器人计算平台。两款模块预计2027年第一季度上市。
一位推文回复者(@nalarian21)用一句话概括了规格背后的含义:"Imagine the power of a supercomputer inside a lunchbox-sized robot."据其披露,波士顿动力、Amazon Robotics和发那科已经在基于Thor平台进行开发。
T3000的865 TFLOPS是什么概念?作为参照,NVIDIA目前旗舰数据中心GPU H100的FP8算力约为2000 TFLOPS。一块70W的T3000模块,FP4算力接近H100 FP8的一半。考虑到机器人应用场景对推理延迟的要求远高于对训练规模的要求,这个算力水平足够支撑实时视觉推理和动作规划。
Cosmos 3 Edge原生运行在T2000和T3000上。NVIDIA的说法是:把前沿世界模型带到边缘GPU上,让物理AI在本地运行。不需要Wi-Fi,不需要5G,不需要数据中心。机器人自己就能想清楚下一步该做什么。
Jetson Thor平台还有一个安全层。@nalarian21在同一条回复中指出,NVIDIA发布了Jetson T3000配套的Halos for Robotics安全系统,用于保障机器人与人协作时的安全。黄仁勋本人也曾在公开场合承认自主机器人"potentially could be dangerous"。
T2000/T3000的定价策略尚未公布,但T2000的16GB内存和40W功耗组合暗示了一个亲民的价位。如果定价合理,它将把物理AI的门槛从少数几家财力雄厚的机器人公司拉低到中小型制造企业也能触及的水平。
黄仁勋的下一个万亿故事
回到黄仁勋在7月30日推文里说的那句话:"Physical AI is here: the next wave of AI and the foundation of the next industrial revolution."
物理AI不是一个新概念。黄仁勋已经讲了至少两年。2024年GTC上他就说过"未来所有会动的东西都将是机器人",2025年CES上他进一步细化了"三台计算机"(训练、仿真、部署)的框架。但2026年7月,从东京到SIGGRAPH,他把这个概念变成了一张可以执行的施工图。
这张图上有四个要素:模型(Cosmos 3 Edge,开源,40亿参数),芯片(T2000/T3000,Q1 2027上市),客户(22家日本巨头已入局,从丰田到软银),以及资金(日本政府62亿美元加NVIDIA自身体系投入)。
NVIDIA在数据中心业务上的表现给了物理AI故事一个坚实的起点。根据Motley Fool的报道,NVIDIA管理层预计从2025年到2027年,Blackwell和Rubin芯片将贡献约1万亿美元收入。物理AI在短期内不会取代数据中心成为NVIDIA的营收主力:其边缘计算业务(机器人、汽车、PC)上季度收入为64亿美元,约为数据中心业务的1/12。但如果Morgan Stanley预测的10亿台人形机器人成为现实,哪怕其中十分之一搭载NVIDIA的计算平台,那也是一个万亿级市场。
推文引用区的一位用户(@TheAIShrink)写道:"The shovels guy announcing the mine is real."卖铲子的人说金矿是真的。她接着补了一句:"$5T valuation needs one thing: someone buying the robots."
这是物理AI叙事中最关键的不确定性。NVIDIA可以造出最好的模型和芯片,日本可以提供最精密的机械,但最终的闭环需要有人为"能搬箱子的AI机器人"买单。黄仁勋的赌注是:当22家日本工业巨头同时入场,当日本政府把62亿美元放进牌桌,这个闭环会比任何人预想的更快形成。
7月31日,这条推文还在持续发酵。黄仁勋没有出现在镜头前开发布会,没有发布长篇博客。他只发了一条推文——和一个"Learn More"链接。
参考链接: