AREX Feed Article
LightParkour 发布:仅用人类视频,零样本训练人形机器人跑酷,仿真成功率 98.8%
人形机器人的数据采集,终于可以不碰一台真机。
2026 年 8 月初, 团队在 arXiv 上公开了 (论文全称 Light-Loco-Parkour)方法:用一段人类跑酷视频作为种子,在仿真中修复、扩展、蒸馏,最终得到一个可在实体机器人上零样本部署的板载策略。整个过程不需要一次遥操作、不采集一帧真实机器人数据。论文公布的 Isaac Sim 仿真数据显示,Lightbot 0 机器人在 60 cm 障碍上的跨越成功率达到 99.2%,在 70 cm 障碍上为 90.0%。
8 月 3 日, Lightbot 0 的实机演示视频——一台 90 cm 高、18.9 kg 的人形机器人从 chest 位置的深度相机获取输入,自主完成 speed vault、reverse vault、攀爬跨越、楼梯上下和狭窄平衡木行走,技能之间的切换完全由策略自行决定,没有手写状态机,没有技能标签,没有运行时运动参考。
论文信息块
- 论文标题:Light-Loco-Parkour: Versatile Perceptive Whole-Body Locomotion via Multi-Skill Distillation
- 论文链接:
- 开源地址:暂未开源
- 核心成绩:在 Isaac Sim 中,以单板载深度相机策略在 65 cm 障碍上实现 98.8% 跨越成功率;所有技能来自人类视频种子,零真实机器人数据,零样本部署到自研 Lightbot 0 机器人。
跑酷暴露了人形机器人的数据死结
当一个人翻越障碍,手臂撑、膝盖顶、躯干压——全身接触点在哪里、何时受力、力量多大,全都取决于眼前这块具体的障碍物。跑酷把"接触密集型全身运动"的困难摆到了明处:环境本身就是机器人的支撑结构。
但现有的人形机器人学习方法在这件事上分成了两条彼此割裂的路线。运动模仿(motion imitation)方法从人类动捕或视频中提取参考轨迹,让策略逐帧追踪,可以重现空翻、侧手翻等高动态动作,但行为始终被绑在参考分布上——换个障碍尺寸,策略就可能进入分布外状态。强化学习驱动的 locomotion 方法则完全不依赖参考轨迹,通过奖励函数让策略自己发现稳健步态,在楼梯、斜坡等场景上表现优异,但纯奖励优化很难自发涌现出手臂、躯干、膝盖协同发力的全身接触技能——策略倾向于收敛到"只用腿"的行为。
更根本的问题出在数据上。跑酷参考动作不仅要表现力强,还必须精确配对到使其成立的障碍物几何。动捕数据重定向到不同机器人本体再对齐到障碍物,过程极易产生浮空接触、场景穿透或动力学不可行的轨迹。遥操作同样提供不了这些数据——当前的人形机器人和遥操作界面根本无法可靠执行高冲击力的跑酷交互。
LightParkour 的解决思路是:与其为每种障碍、每种接触模式采集新数据,不如从一条短的人类运动视频中恢复交互意图,然后让仿真来生成变化。
Real→Sim→Real:一段视频,四次变身,一次部署
LightParkour 的 pipeline 分为四个模块,核心逻辑是从真实世界取种子、在仿真中培育、再回到真实世界部署。
第一步:物理修复——仿真把重定向"修"对
从人类视频中提取运动并重定向到 Lightbot 0 的骨架上,这一步只得到运动学上貌似合理的关节轨迹。但脚底会滑动,手和膝盖会穿透障碍物表面,人类运动的动力学也远超机器人关节的力矩极限。
团队的做法是在 Isaac Sim 中训练一个 physics tracking policy:把这个"物理上不成立"的初始参考轨迹放到全物理仿真里,让策略在重力、接触力、关节力矩限制下实际执行它。策略输出关节位置目标,PD 控制器驱动,奖励函数同时追踪参考轨迹并惩罚不合理的接触。跑出来的轨迹才是"物理修复"后的干净参考——动作语义保留,但每帧都符合机器人的动力学约束。
第二步:地形扩展——一次成功,就把障碍物升高一点
修复后的参考只对应一种障碍物高度。论文的做法是:把上一次成功执行的 rollout 作为下一次训练的参考,同时将障碍物提高 5–10 cm,重新训练。循环往复,一段 45 cm 的攀登参考就被扩展成覆盖 45–75 cm 的连续参考族——最高达到机器人站立高度(90 cm)的 83%。
整个过程中,只有最初的"运动–障碍物"配对需要人工对齐一次,其余变化由物理仿真和课程学习(curriculum)自动驱动。
第三步:特权教师→统一学生→DAgger 蒸馏
在仿真中,团队先训练四个"特权教师"策略:一个负责平地 locomotion(速度追踪),另外三个分别负责攀爬跨越(climb-and-step)、speed vault 和 reverse vault。教师策略享有真实机器人永远拿不到的信息——干净的高度扫描图(height scan)、精确的地形几何、脚底接触力等。
接下来的蒸馏分两层。第一层是多专家 DAgger:让学生策略自己驾驶(从高度扫描图和本体感知输入),教师策略在学生实际访问的状态上标注"正确的动作应该是什么"。DAgger 的关键在于纠正的是学生自己犯的错,而不是教师独立表演的轨迹,从而避免误差累积。蒸馏产物是一个统一的高度扫描策略,同时具备 locomotion 和三项全身技能。
第二层是深度蒸馏:将高度扫描策略再蒸馏为一个仅依赖板载深度相机(单目 depth)加本体感知(关节角度、速度、IMU 方向)的循环神经网络策略(MLP→GRU→MLP)。GRU 的隐藏状态在帧间传递,让策略在不依赖外部里程计的情况下隐式推断未测量的速度状态,并"记住"已经滚出相机视野的地形——在跨越障碍时,胸前的深度相机可能在接触最关键的瞬间恰好丢失障碍物视野。
最终部署的策略跑在 50 Hz,输入仅深度图、本体感知和速度指令,输出关节位置目标。无运行时参考轨迹,无技能标签,无外部追踪。
第四步:奖励驱动的技能切换——策略自己决定什么时候翻
四个技能揉进一个网络不会自动产生切换。论文的做法是在蒸馏后的策略上增加一个 reward-only transition 训练阶段:不引入任何专家指导或手写状态机,只通过强化学习奖励让策略从 trial-and-error 中学会何时离开 locomotion、进入全身技能、何时返回。速度指令和深度图就是触发切换的全部信息。
从 33% 到 98%:蒸馏、记忆与技能切换的量化账本
论文在 Isaac Sim 中对四个障碍物高度(60 / 65 / 70 / 75 cm)进行了消融实验。所有数字均为仿真数据,实机部分仅以视频形式呈现零样本迁移效果。
在 65 cm 障碍上,完整的 LightParkour 策略成功率为 98.8%。去掉循环记忆(GRU)后跌至 56.6%,去掉最终任务微调后为 89.8%。在 70 cm 障碍(0.77× 机器人身高)上,完整策略成功率为 90.0%,去掉循环记忆后仅剩 34.2%。
最极限的 75 cm(0.83× 身高)暴露出一个明确的感知–控制鸿沟:部署策略的成功率骤降至 33.4%,但享有地面真值高度扫描的特权教师仍维持在 98.6%。差距全部来自感知——一台小循环网络在单深度相机 50 Hz 下的信息瓶颈,而非运动能力的天花板。
在技能切换维度,没有 transition 训练的孤立技能只有 33.0% 的端到端成功率。加入 reward-only transition 训练后跳至 98.0%。论文用一张 GRU 隐藏状态的 t-SNE 可视化图呈现了切换过程:策略的隐藏状态在 locomotion、过渡态、跑酷态之间形成了一条可学习的通路,而非随机跳变。
整体来看,多层蒸馏和循环记忆的代价也能量化:从四个特权教师压进一个板载深度策略,成功率在 70 cm 障碍上从 99.2% 降到 90.0%,在 75 cm 上从 98.6% 降到 33.4%。把这 33.4% 称为"将四个特权专家塞进一个小循环网络所付出的可测量代价"。
策略学会了"什么时候翻"——而不仅仅是"怎么翻"
在多障碍混合场地上,Lightbot 0 的策略根据深度图和速度指令自行判断何时保持 locomotion、何时进入全身技能、何时返回——整个过程没有 one-hot 技能标签、手写状态机或运行时运动生成器。
这意味着策略不是被"磁吸"到障碍物上——这是一个现有方法(如 PHP)中已知的问题:当参考轨迹被写入策略输入,机器人似乎会被前方的任何障碍物吸引过去,而无法忠实地追踪速度指令。LightParkour 的策略在运行时完全不接收参考轨迹,只接收速度指令和深度图,因此在开放地形上可以正常行走,只在障碍物前主动切换技能。
团队将同一 pipeline 应用于一项独立的 loco-manipulation 任务:用刚性盒子训练的策略,零样本测试时换成了一个柔性的球——球的质量、形状和接触动力学与训练物体完全不同。项目页面将这一结果描述为"初步但令人鼓舞",并明确指出"跑酷是我们出发的地方,不是方法的终点"。