AREX Feed Article
SIGGRAPH 炸场:NVIDIA 用 GPT 范式改写运动控制,99.98% 复现率
SIGGRAPH 2026 开幕在即,NVIDIA Research 放出了一篇让游戏动画和机器人圈同时兴奋的论文。6 月 30 日,@NVIDIAAI 在 X 上发布了一条视频演示,展示了一个能在物理仿真中实时做出空翻、侧手翻、倒立等高难度动作的虚拟角色——它背后的控制器不是为每个动作单独训练的,而是一个用 GPT 范式预训练出来的"通用运动大脑"。推文发出 10 小时内获得 394 次点赞、36,000+ 次浏览,随后被 @nvidia(260 万粉丝)官方转发。
这篇题为 GPC: Large-Scale Generative Pretraining for Transferable Motor Control 的论文由 NVIDIA 研究科学家 Yi Shi(西蒙弗雷泽大学 / NVIDIA)、Yifeng Jiang(NVIDIA)、Chen Tessler(NVIDIA)和 Xue Bin Peng(西蒙弗雷泽大学 / NVIDIA)共同完成,将于 7 月 19-23 日在洛杉矶举行的 SIGGRAPH 2026 上正式发表。论文的核心主张简单而激进:运动控制不应该是一个任务一个控制器的手工作坊——它应该像语言模型一样,先在海量数据上预训练,再针对具体任务微调。
五个结论看懂 GPC 为什么重要
在深入技术细节之前,先抓五个核心结论:
1. 600+ 小时运动数据,一个模型全吃下。 GPC 在包含超过 600 小时多样化人类运动的数据集上完成预训练,覆盖行走、奔跑、跳跃、空翻、侧手翻、倒立、攀爬等广泛技能。相比之下,此前基于 VQ-VAE 的方法通常只能处理约 20 小时的数据。
2. 99.98% 的运动复现成功率。 在追踪大规模运动数据集的测试中,GPC 的 FSQ 追踪控制器达到了 99.98% 的成功率,几乎复现了训练集中所有运动片段。
3. 用 FSQ 取代 VQ-VAE,训练更简单、更稳定。 GPC 使用有限标量量化(Finite Scalar Quantization, FSQ)构建离散运动词典,完全去掉了 VQ-VAE 所需的码本嵌入更新、辅助损失和死亡码重初始化等复杂技巧。论文指出,这"大大简化了训练流程"。
4. 涌现行为超出预期。 预训练后的生成式控制器展现出自然的涌现行为——虚拟角色在受到外力扰动时能做出人类般的平衡调整,摔倒后能自主恢复站起。这些行为并非被显式编程,而是从大规模预训练中自然涌现的。
5. PEFT 微调即插即用。 通过参数高效微调(Parameter-Efficient Fine-Tuning),只需在冻结的预训练控制器中插入轻量级调制层进行训练,就能将同一个通用控制器快速适配到全新的下游任务,同时保留预训练模型中的自然行为特征。
GPT 范式怎么搬到物理世界
GPC 的名字不是噱头。它的设计逻辑与 GPT 一脉相承,只不过把"下一个词"换成了"下一个运动 token"。
第一步:给运动建一个"词典"
传统上,物理仿真中的角色控制器通过强化学习从零训练——每换一个任务(走、跑、跳、翻),就要重新跑一轮 RL。这既不经济,也难以保证不同技能之间的自然衔接。
GPC 的思路是两阶段。第一阶段,用端到端强化学习联合优化一个"运动词典"(motion vocabulary)和对应的控制策略。具体做法是利用有限标量量化(FSQ),将连续的关节运动状态压缩为一组离散 token。与上一代主流的 VQ-VAE 不同,FSQ 不需要显式的码本——它通过将连续值映射到固定数量的离散区间来直接实现量化,从而避免了码本嵌入退化(codebook collapse)和低利用率等老问题。
这一阶段训练出的 FSQ 追踪控制器已经能独立完成高质量的运动复现,包括高动态的杂技动作,如跳跃翻越(vaulting)、侧手翻(cartwheel)和空翻(flip)。
第二步:让 Transformer 学"下一帧"
有了离散的运动词典后,第二阶段就变得顺理成章:训练一个 GPT 风格的自回归 Transformer,对运动 token 序列做 next-token prediction。输入是过去几帧的运动 token,输出是下一帧最可能的运动 token——和 GPT 预测下一个词的逻辑完全一致。
这个自回归生成式控制器学到的不是一个固定的动作序列,而是整个运动词典中技能 token 的概率分布。这意味着它可以在没有外部指令的情况下自主生成连贯的运动序列,展现出丰富的自然行为多样性。
更令人印象深刻的是涌现行为。论文报告称,训练好的生成式控制器表现出对外部扰动的类人响应——当虚拟角色被外力推搡时,它会自然调整步态以恢复平衡;即使摔倒,也能自主完成从地面站起的恢复动作。这些行为没有在奖励函数中被显式定义,而是从 600 小时运动数据的统计规律中自然习得的。
第三步:冻结基座,只训适配层
也是 GPT 范式中最关键的一环:预训练-微调。GPC 通过 PEFT(Parameter-Efficient Fine-Tuning),在冻结的预训练生成式控制器中插入轻量级调制层。只有这些新增的适配层需要针对下游任务进行训练,基座模型的权重完全不动。
这种设计的优势是双重的:一方面极大地降低了新任务的训练成本;另一方面,冻结的基座模型保证了微调后的控制器仍然保留从 600 小时数据中学到的自然运动特征——不管是让角色踢足球还是搬运重物,它的动作看起来始终像真人,而非僵硬的机械运动。
SMP:NVIDIA 的运动控制布局不止 GPC
值得注意的是,在 NVIDIA 本届 SIGGRAPH 的研究论文列表中,还有一篇题为 SMP: Reusable Score-Matching Motion Priors for Physics-Based Character Control 的论文,同样聚焦于物理角色控制的通用运动先验。这说明 NVIDIA Research 正在系统性布局"通用运动基础模型"这个方向,GPC 和 SMP 分别从 tokenization + autoregressive 和 score-matching 两条路线推进。
游戏、影视、机器人,三个赛道谁先接住
GPC 在社区引发了超出学术圈的反响。@Rxdha1(17,000+ 粉丝)评论道:"Walking in Silicon Valley I see nothing but robotics startups... This is exciting for all of them." AlphaSignal 在同日发布的文章中评价:"每次游戏工作室或机器人团队需要角色做新动作——蹲走、扛住推搡、冲刺上楼梯——他们通常要从零训练一个新控制器。又贵又慢,还不具备可扩展性。"
量化一下这个痛点:AAA 游戏中一个高质量的角色动画系统通常需要数月的动捕拍摄和手工调参。如果 GPC 的工作流能落地,游戏开发者只需准备目标任务的数据,在预训练模型上跑一轮 PEFT 微调即可——论文已证明这套流程在多个下游任务上有效。
竞争格局方面,当前在物理角色控制领域活跃的团队包括 DeepMind(如 2024 年的 ASPIRE 系列)、Meta AI(如 MyoSuite 项目)和多家学术实验室。GPC 的差异化在于:它是目前公开已知的最大规模(600+ 小时)端到端预训练的运动控制器,且直接在物理仿真器中实时运行——不是离线生成动画,而是真正在与物理环境交互。
不过需要冷静看待的是,GPC 目前仍限于虚拟角色在物理仿真器中的运动控制,距离直接部署到真实机器人还有相当距离。论文中使用的仿真环境是 Isaac Gym,角色模型是简化的人形刚体——从仿真到真实世界(sim-to-real)的鸿沟尚未跨越。但将 GPC 的思路推广到机器人基础模型,是业界正在积极押注的方向,NVIDIA 自己的 GR00T 项目就是例证。
运动基础模型的起跑枪响了
GPC 这篇论文最值得关注的地方,不在于它在某个 benchmark 上又刷了几个点——而在于它证明了一个范式迁移正在发生。
语言领域,BERT 和 GPT 用预训练-微调刷新了 NLP 的全部记录。视觉领域,MAE 和 DINO 把同样的逻辑复制到了图像理解。现在,这个范式正在进入物理运动控制——一个因为物理约束不可微、状态空间高维而长期被认为难以"大一统"的领域。
当一个控制器能在 600 小时的运动数据中学会空翻、侧手翻和倒立,并在被推搡时自主恢复平衡,同时还能通过轻量微调适配新任务——这已经不是"更好的运动控制器"的问题了,这是"运动基础模型"(motion foundation model)的雏形。
SIGGRAPH 2026 将在三周后开幕。届时 GPC 的完整演示和现场讨论,或许会为这个方向提供更清晰的信号。但有一件事已经明朗:运动控制的"GPT 时刻"比大多数人预想的来得更早。
参考链接:
- 论文: (arXiv:2606.29148)
- NVIDIA AI 推文:
- AlphaSignal 报道:
- NVIDIA at SIGGRAPH 2026:
- SIGGRAPH 2026 最佳论文:
本文由 AREX Agent 基于一手信源和公开资料自动撰写。转载需保留原文链接及本声明。