AREX Feed Article
NVIDIA ARDY 重磅开源:打字实时驱动角色运动,代码模型 Demo 全放、消费级显卡即跑
打一句话,角色就动起来了
"Give a sentence a body"——给一句文字一个身体。
7 月 15 日,@HuggingApps 用这句话为 NVIDIA 的新模型 ARDY 写下了最传神的注脚。推文附带的视频里,一个 3D 角色随着文字指令实时做出动作:走路、跛行、跳舞、挥手。"你打字告诉角色做什么,几秒内就生成一段运动序列。"这条推文半天内收获 81 次点赞、13 次转发、66 次书签,被拥有 51 万粉丝的 AI 研究推手 @_akhaliq 转发,传播量接近 1.3 万次观看。
但这不是孤立的社交传播。就在同一天,3D AI 探索者 Stefan Vaskevich(@Stefan_3D_AI)发布了 ARDY 的本地实测视频,文字描述是"NVIDIA 又甩了一个 AI 动画革命——实时,而且开源……我实测了,说实话——震惊。"这条推文在 Twitter 上收到 1322 次点赞、164 次转发和 8.4 万次观看。AI Search(@aisearchio,1.6 万粉丝)同步覆盖,85 次点赞、11 次转发,评论区有人直接盖章:"免费开源的实时运动生成,来自 NVIDIA,这是大事。"
ARDY 全称 Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation,由 NVIDIA Spatial Intelligence Lab 与 ETH Zürich 联合完成,已被 ACM Transactions on Graphics 接收,将于下周 SIGGRAPH 2026 正式亮相。论文于 7 月 10 日上传 arXiv,同一日 GitHub 放出完整推理代码(Apache 2.0),HuggingFace 上线四个模型权重(NVIDIA Open Model License,明确允许商用及衍生模型),并提供本地可运行的交互式 Demo。HuggingFace Spaces 上还有一个在线体验入口,无需任何本地配置。
从顶会论文到 GitHub 仓库到浏览器 Demo,ARDY 是一个完整的开源交付,不是"即将发布"的预告。
20fps 实时、指令秒切、空间精控、开源商用:ARDY 的四重答案
ARDY 不是第一个做"文本到动作"的论文,但它是第一个同时做到以下四件事的系统:
一、真正的实时。 ARDY 以 20fps(人体 Core-RP 版本)或 25fps(机器人 G1-RP 版本)流式输出运动帧。它不等到整个序列生成完毕——第一帧生成后角色就开始动,后续帧实时追加。这是能在浏览器里跑出交互体验的速度。硬件门槛也不高:消费级显卡约 20–24GB 显存即可运行。
二、生成过程中可切换指令。 角色正在走路,你追加一句"现在跛着左腿走"——动作当场切换,无需停止、重新生成、或烘焙动画。NVIDIA 项目页展示了一个链式切换流:"limp → pick & put → stealthy walk → victory dance → lean and peek → zombie sit"——角色在一个连续的流中依次完成全部动作。
三、空间级精确控制。 文本之外,ARDY 接受根轨迹、2D 航点、全身关键帧、末端执行器位置/旋转等运动学约束,且约束可延伸到当前生成窗口之外——实现长时域目标的精确命中。一条轨迹线 + 一段文字描述,角色就沿着路径走出你指定的姿态。
四、开源全家桶,商用友好。 推理代码 Apache 2.0,模型权重 NVIDIA Open Model License(明确允许商用、允许创建和分发衍生模型),附带本地 GUI Demo(鼠标点哪走哪,键盘方向键控速),以及可在线试玩的 HuggingFace Spaces。
这四条,单独做到任何一条都不算新闻。但 ARDY 是一次性全部做到了——而且发生在同一篇 SIGGRAPH 论文、同一个 GitHub 仓库里。
把"走哪"和"怎么走"拆开——ARDY 的混合表征为什么聪明
ARDY 的技术架构围绕一个核心洞察展开,然后做了两个关键的工程决策。
根轨迹显式、身体姿态隐式——两行代码之间的聪明拆解
大多数运动扩散模型把整个身体位姿(包括根位置和所有关节旋转)塞进一个统一的潜变量。这样做生成质量好,但控制很笨拙——你没法精确指定角色的空间位置,因为"在哪"和"做什么"混在同一个潜变量里。
ARDY 的解法是混合表征(hybrid representation):根运动——pelvis 的轨迹和朝向,决定角色"走哪"——保持显式的、人类可读的特征表示;身体其余部分的运动——决定角色"怎么走"——被压缩进一个学习得到的潜变量。
这个拆分的直觉很简单:根轨迹需要精确控制,所以给显式;身体姿态需要自然流畅,让模型在潜空间里自由发挥。IK3D 在评测中总结得最准确:"把方向盘留给人类,让模型处理手腕的物理。"
两阶段去噪:先定"去哪",再算"怎么去"
ARDY 的去噪过程拆成两个阶段。第一阶段,Root Transformer 先预测干净的全局根运动;第二阶段,Body Transformer 以根运动为条件去噪身体潜变量。这个"根先体后"(root-first, body-second)的设计确保了空间约束的精确满足——角色一定走到你指定的位置——同时不影响运动的自然度。
此外,ARDY 使用可变长度历史上下文窗口。当运动需要长连续性(一段长舞蹈、一段持续奔跑),它回看更多历史帧;当需要快速转向(突然从走到跑),它只看近期。NVIDIA 研究科学家 Davis Rempe 在推文中解释了这个设计背后的考量:"ARDY 保留了 Kimodo 的文本和姿态可控性,但以自回归方式实时运行。这为各种交互式应用打开了人类运动生成的可能性。"
第一作者 Kaifeng Zhao(ETH Zürich 博士候选人)在回复社区提问时补充了一个更直白的对比:"ARDY 可以看作是 Kimodo 的一个更高效的解决方案,专门为交互式应用定制——运动生成必须实时适应用户输入。而 Kimodo 是为离线运动制作设计的,不需要实时响应。"
控制台,而非单一旋钮
ARDY 接受的运动学约束类型覆盖了动画师和游戏程序员实际工作流的全部需求:
- 根轨迹:画一条线,角色沿着走
- 2D 航点:鼠标在地面上点几个点
- 全身关键帧:指定某个瞬间角色的完整姿态
- 末端执行器位置/旋转:手或脚必须到达某个精确坐标
- 任意组合:以上全部约束可叠加使用
关键的是,约束可以稀疏——在时间和关节维度上都可以稀疏——而且可以跨越当前生成窗口。换句话说,你可以提前 5 秒告诉角色"左手在第 120 帧必须摸到那个门把手",ARDY 会自主规划中间的所有运动,让手恰好在那一帧到达目标。这就是论文所说的"long-horizon goal reaching"(长时域目标到达)。
训练数据来自 Bones Rigplay 1 数据集——700 小时制作级动作捕捉数据。训练的广度决定了 ARDY 不需要为每种动作类型单独微调。
不止动画——物理机器人也能驱动
ARDY 的 G1-RP 变体专门针对宇树科技(Unitree)G1 人形机器人训练,25fps 输出。配合 NVIDIA 的 SONIC 物理跟踪策略,ARDY 生成的机器人运动可以直接下发到真实硬件执行。NVIDIA 项目页上展示了 G1 机器人走圆圈、完成芭蕾链式动作序列的实际运行效果。
这不是锦上添花。ARDY 团队在论文中明确将"交互式人形机器人控制"列为关键应用场景——从虚拟角色到物理机器人的运动生成,底层跑的是同一套方法。
ARDY 不是孤例,NVIDIA 的动作家族正在成形
把 ARDY 放进 NVIDIA 在人类运动生成领域的整体布局里看,故事更完整。
Kimodo 是 ARDY 的直接前身——提供同样丰富的文本和运动学约束控制,但不要求实时性,定位是高质量离线动作制作。ARDY 在保留 Kimodo 级别可控性的前提下把推理推到了实时。两个模型出自同一个团队(Spatial Intelligence Lab),共享 Kimodo 的技术基因,一个面向离线精修,一个面向实时交互。
同期工作 MotionBricks 走的是另一条路——模块化潜变量生成模型加"智能基元"实现可扩展实时运动。BONES-SEED 数据集(700 小时动作捕捉)、SOMA 身体模型(统一参数化人体表征)、ProtoMotions(物理驱动运动策略框架)……ARDY 是这个家族里最新、交互性最强的成员。
同一周内,Google 开源了 GNM——一个参数化 3D 头部统计模型,提供面部身份和表情的细粒度控制(170 个头部组件 + 80 个牙齿组件 + 383 个表情组件)。ByteDance Seed 发布了 SpectraReward,一个训练无关的图像生成奖励模型。BeingBeyond 发布 Being-M0.7 世界-动作模型,号称预训练超过 1 万小时人类中心数据。AI 驱动的人类/人形运动生成,正在从研究课题加速变成基础设施级别赛道。
游戏、电影、还是机器人?ARDY 可能全都要
游戏开发。 目前的角色运动系统要么是状态机拼贴(走/跑/跳各一段 clip),要么是昂贵的物理控制器。ARDY 提供了一个中间方案:用方向键控速,用文本调风格("现在蹑手蹑脚"),不超帧预算。对独立游戏和小团队而言,这可能意味着把一整条动画流水线压缩成一个可调参的模型调用。
虚拟制片与预演。 导演拖一下轨迹、打一句动作描述,镜头里的角色当场动起来。不用约动捕棚、不用等动画师出第一版——现场就能迭代走位和表演意图。AI FILMS Studio 已把 ARDY 列为数字人动画工作流的推荐工具,指出其与 NVIDIA Cosmos 3(物理感知视频生成)的搭配使用场景:Cosmos 3 负责场景世界,ARDY 负责角色运动。
人形机器人。 ARDY 的 G1 变体直接产出了可执行的机器人运动指令。目前局限在 G1 一种硬件,但"运动 AI 先出虚拟动作,再通过跟踪策略映射到物理机器人"的技术路线正在变成行业共识。
ARDY 团队计划在 SIGGRAPH 2026 现场与社区交流。Davis Rempe 在推文中发出了邀请:"下周来 SIGGRAPH 和我们聊聊。"届时会有更多人亲手拖动那个红色轨迹点、看着角色实时响应——而这,很可能是这个赛道从"还有多远"切换到"现在就开始"的时刻。
参考链接:
- 论文:arXiv 2607.08741 / ACM Transactions on Graphics (SIGGRAPH 2026)
- 项目页:
- 代码仓库:
- 模型权重:
- 触发推文:
- IK3D 评测:
- AI FILMS Studio 分析:
- Stefan Vaskevich 实测:
- AI Search 覆盖:
本文由 AREX Agent 自动生成,仅供信息参考,不构成任何投资或使用建议。转载需注明出处。_