AREX Feed Article
自动驾驶软件正在从护城河变成自来水
2026 年 8 月 4 日,NVIDIA 创始人兼 CEO Jensen Huang 用他开通仅 39 天的 X 账号发了一条推文:"今天,我们发布 Alpamayo 2 Super,我们面向自动驾驶的前沿开放推理模型。"
这条推文在不到一小时内收获了近 3000 个赞和超过 350 次转发。NVIDIA 官方账号和 NVIDIA DRIVE 账号同步转发。转发量本身不是重点。重点是这条推文背后的信号:NVIDIA 不再满足于卖芯片给自动驾驶公司。它直接把最好的自动驾驶基础模型开源了。
一台会思考的车
Alpamayo 2 Super 的核心突破可以用一句话概括:它不只是"看见"道路,而是"理解"道路。
传统自动驾驶系统的工作方式是感知→预测→规划。摄像头和雷达检测障碍物,算法预测运动轨迹,规划模块决定下一步。每一步都是孤立决策。系统"看到"一个骑自行车的人正在接近,但不会"推理"这个人可能为了躲避前方的坑洞而突然转向。
Alpamayo 2 Super 改变了这个范式。它是一款 340 亿参数的 VLA(Vision-Language-Action,视觉-语言-动作)模型,在输出方向盘转角和油门开度之前,先输出一段自然语言的因果推理链(Chain-of-Causation)。
Jensen Huang 的原话是:"Beyond seeing, Alpamayo understands and reasons through the complex world — thinks before it acts."(不只是看,Alpamayo 理解并推理复杂的现实世界——先思考,再行动。)
更关键的是,这款模型以 OpenMDW-1.1 协议开放商用。任何团队都可以下载权重、微调、蒸馏、部署。Jensen Huang 给出的理由是:"Open models advance safety and security."(开放模型提升安全性和可靠性。)
目标场景覆盖了整个自动驾驶的长尾:robotaxi、卡车、接驳车、配送车、拖拉机,以及"未来数十亿台移动机器人"。
34B 参数、360° 环视、因果推理链——Alpamayo 2 Super 的技术底牌
Alpamayo 2 Super 建立在 NVIDIA Cosmos 3 Super Reasoner 的 320 亿参数 VLM 主干之上,是前代 Alpamayo 1 Nano(100 亿参数)参数量的三倍以上。但参数量的增长只是故事的一部分。
任务:从单视角到全环绕感知。 前代 Alpamayo 仅使用前视摄像头。Alpamayo 2 Super 将输入扩展到 7 个以上摄像头,覆盖前、侧、后视角,实现 360° 情境感知。
结果:模型对变道、匝道合流和十字路口穿行的决策质量显著提升。这些正是 L4 自动驾驶事故率最高的场景。
关键发现:全环绕感知不仅提升了安全性,还让模型的因果推理链更有逻辑。它"知道"右后方有车快速接近时,不会建议向左变道。
任务:从轨迹预测到高层决策。 Alpamayo 2 Super 新增 Meta-Action 输出:让行、变道、停车等宏观驾驶决策。传统模型只输出轨迹点,下游规划器需要把轨迹点翻译成具体动作。Meta-Action 让模型直接预测高层决策,规划器只需执行。
关键发现:这个设计使得模型的行为更可解释,监管机构可以审查模型在关键场景下的"思考过程"。
任务:用大模型自动标注数据。 自动驾驶的数据标注是行业痛点。一个小时的驾驶数据,人工标注可能需要 100 小时。Alpamayo 2 Super 引入推理自动标注(reasoning auto-labeling)和 2D grounding,34B 参数的基础模型能为小模型生成高质量推理标签。NVIDIA 称标注周期"从数月压缩到数天"。
关键发现:标注成本是自动驾驶公司最大的隐性开支之一。如果 34B 模型能替代人工标注,整个 AV 数据管线的经济学将被重写。
任务:让模型在闭环中从错误中学习。 同期发布的 AlpaGym 是一个开源的高吞吐量闭环强化学习框架。传统开放环路训练在静态数据集上评估模型,模型看不到自己决策的后果。
AlpaGym 在 NVIDIA AlpaSim 仿真环境中持续运行模型。每一次刹车、转向、导航选择都会改变环境,累积误差和边缘案例故障被直接暴露。NVIDIA 还发布了基于 CAT-K 的学习型交通模型,让仿真中的其他车辆对自车的动作做出反应。
关键发现:闭环训练解决了自动驾驶最隐蔽的问题:"沉默故障"(silent failures)。一个在开放环路测试中表现完美的模型,在闭环中可能因为一个不合理的变道决策导致三秒后的碰撞。
任务:生成罕见的危险场景。 Cosmos-Dreams(原名 OmniDreams)是一个生成式世界模型,能用真实车队数据重建照片级仿真场景,并生成长尾危险场景:鬼探头行人、逆行车辆、路面塌陷,供模型在部署前大规模验证。
整套工具体系已在 GitHub(NVlabs/alpamayo-recipes)和 Hugging Face 上线。模型权重和推理代码于 8 月 4 日正式开放。
40 万次下载,一座 COMPUTEX 奖杯,NVIDIA 的 AV 版图
Alpamayo 家族的故事始于 2026 年 1 月的 CES。当时 NVIDIA 首次展示了 Alpamayo 1 Nano 和 1.5 Nano,两款 100 亿参数的开源推理 VLA 模型,专为 L4 自动驾驶开发。发布后六个月内,模型累计下载量接近 40 万次,获得 COMPUTEX 2026 Best Choice Award 车载技术与智能座舱类奖项。
这不仅仅是数字。40 万次下载意味着全球有大量团队,从车厂研发中心到大学实验室,已经在使用 Alpamayo 构建自动驾驶系统。NVIDIA DRIVE 团队由 Marco Pavone(斯坦福大学航空航天系副教授、NVIDIA AV 研究负责人)和 Boris Ivanovic(NVIDIA 自动驾驶高级研究科学家)等研究人员领导,团队分布在圣克拉拉和全球多个研发中心。
生态配套也在加速。2026 年 7 月,NVIDIA 宣布与丰田扩大合作,涵盖汽车、机器人和城市智能系统。同时,NVIDIA Halos OS 为 AI 驱动车辆提供功能安全基础。NVIDIA 还在 COMPUTEX 2026 展示了 Alpamayo 的"有声推理"demo:车辆用自然语言实时解释自己的驾驶决策:"前方十字路口视线受阻,我减速以留出反应时间。"
Jensen Huang 选择用个人 X 账号发布这个消息,而非传统的新闻稿路径。考虑到他的账号至今只运营了 39 天,这个选择本身就是信号:NVIDIA 正在用创始人 IP 直接与开发者社区对话,绕开媒体中介。
AI 增长营销机构负责人 Damian Player 在引述推文中所写:"全球市值最高的公司正在通过一个只开了 11 天(注:实际为 39 天)的 X 账号发布前沿模型。传统媒体正在消亡。"
谁最紧张?特斯拉,以及所有闭源派
Alpamayo 2 Super 的开源商用,直接冲击的是特斯拉 FSD 的商业逻辑。
特斯拉的自动驾驶策略建立在封闭系统之上:FSD 是特斯拉汽车独有的付费软件功能,硬件(HW4/HW5)和软件深度绑定。Elon Musk 多次在财报会上强调 FSD 是特斯拉最重要的利润引擎,他说:"如果 FSD 成功,特斯拉的毛利率将超过任何一家汽车公司。"
但 NVIDIA 的开源策略提出了一个尖锐的替代方案:如果全球任何一家车厂都能免费获得 34B 参数的前沿推理模型,FSD 的定价权从何而来?
引述推文中的反应颇为直白。投资研究机构 AJ Investment Research 的分析师 alojoh 写道:"FSD 技术将在 4-5 年内商品化,成为所有高端新车的标配。FSD 的价值将归零,因为它只是软件。"另一位用户 0xdominus 说得更简洁:"$TSLA is fucked。"Kryptos Opus 则将焦点对准了基准测试中的 OOD(分布外)推理分数:"43.3 vs 39.6,在把 robotaxi 送进沟里的那种边缘案例上,这个差距是决定性的。"
io.net 联合创始人 Tory Green 指出了更大的格局:"最大的解锁可能不是更好的车,而是一个通用的推理层,降低了每一家制造物理世界机器的公司的门槛。这比自动驾驶本身要大得多。"
Hugging Face 产品负责人 Jeff Boudier 确认模型已上线 Hugging Face:"34B 参数,OpenMDW-1.1 协议,开放微调和商用。"
TIER IV(日本自动驾驶开源软件 Autoware 的开发商)CEO 加藤真平用日语评论:"开源 × 开放数据 × 开放模型的乘法效应。"日本开发者 Devid_SUN_ 补充道:"丰田、日产和整个日本生态现在可以全面投入。我们将很快看到专门为日本复杂道路调优的模型。"
但并非所有人都买账。Wall St Engine 只回了一个词加引号:"'open-source'",暗示 OpenMDW-1.1 协议并非传统意义上的开源许可。Filecoin 官方账号则从数据存证角度提出了一个技术问题:robotaxi 和卡车在公共道路上的决策记录"应该在事故调查启动时——可能是数月或数年后——仍然可验证。"
编辑观察:Alpamayo 2 Super 只是 NVIDIA 更大棋局中的一步。从芯片(DRIVE AGX Thor)到操作系统(Halos OS)到仿真(Omniverse NuRec、Cosmos-Dreams)到模型(Alpamayo),NVIDIA 正在构建自动驾驶的完整垂直栈。
唯一不同的是,这个栈的大部分是开放的。逻辑很清晰:底层越开放,顶层应用越多,芯片卖得越快。
Jensen Huang 的算盘:让模型免费,让算力收费
回到 Jensen Huang 的那条推文。"The next wave of AI is robotics — and it starts with autonomous vehicles."(AI 的下一波浪潮是机器人——从自动驾驶开始。)
这句话不是修辞。NVIDIA 的市值在今年突破了 4 万亿美元,驱动力是数据中心 GPU 的爆炸性需求。但训练大模型只是上半场。下半场是推理。数百亿参数的 VLA 模型在数百万辆车上实时运行,每一帧摄像头画面都需要经过一次前向传播。这个计算量,远远超过训练。
Alpamayo 2 Super 是一个 34B 的"教师模型"。它的设计目标不是在车上跑,而是蒸馏成更小的模型,部署在 NVIDIA DRIVE AGX Thor 芯片上。换句话说:模型免费,芯片收费。NVIDIA 的逻辑链条是:开源最好的模型 → 降低 AV 开发门槛 → 更多公司入场 → 更多车需要车载芯片 → NVIDIA 卖更多 Thor。
这个策略只有在一种情况下会失败:如果市场证明自动驾驶不需要"先思考再行动"的推理模型,传统的端到端行为克隆已经足够。但从 40 万次下载和社区反应来看,市场正在投票。投给推理。
参考链接: