AREX Feed Article
Physical Intelligence 提出 Real-Time Chunking:用 inpainting 解决动作 chunk 衔接,+200ms 延迟下吞吐量零衰减
把 chunk 衔接变成一个图像补全问题。
Physical Intelligence 在 NeurIPS 2025 发表了一篇论文——被 称为「试图解决 action chunk 在真实机器人上执行这一长期痛点」——解决了一个困扰机器人模仿学习已久的工程难题:当 VLA(视觉-语言-动作模型)的推理延迟高达数百毫秒时,如何让机器人的动作 chunk 之间平滑过渡,而不是抽搐、停顿甚至触发安全急停。 用一句话概括了这种张力:「对语言模型,生成快慢的区别是用户满意还是烦躁;对机器人动作模型,则可能是递给你一杯热咖啡还是把它洒在你腿上。」
论文标题:Real-Time Execution of Action Chunking Flow Policies 论文链接: 项目页面: 开源地址:暂未开源 核心成绩:在 +200ms 注入延迟下,RTC 的任务吞吐量完全不受影响,而同步推理线性退化,Temporal Ensembling 直接触发机器人安全急停。
把 chunk 衔接变成一个 inpainting 问题
要理解 RTC 为什么必要,先得看清 action chunking 的尴尬处境。
模仿学习中,让模型一次预测一串动作(chunk)而非单个动作,已经成为标配。Diffusion Policy 和 ACT 证明了这样做能捕捉人类示教数据中的时序一致性。Physical Intelligence 的 π0.5 VLA 每次输出 50 个动作,对应 1 秒的真实时间。但问题出现在 chunk 的边界上:当一个 chunk 执行完毕、下一个 chunk 尚未生成时,机器人只能停下来等——这个停顿不在训练数据里,造成了分布偏移(distribution shift)。
更糟的是,如果你想消除停顿、让推理与执行并行(异步推理),新生成的 chunk 可能与正在执行的旧 chunk 采取完全不同的「策略」。论文用 Figure 2 展示了一个生动的例子:旧 chunk 规划从障碍物上方通过,新 chunk 却选择从下方绕行;两条轨迹在切换点产生巨大的加速度跳变——这对真实机器人可能是灾难性的。naive async 直接切换会导致极高的 out-of-distribution 加速度;Temporal Ensembling(ACT 论文中的方法,对多 chunk 取平均)虽然降低了加速度,却生成了物理上无效的动作。
Physical Intelligence 团队的核心洞察是:把 chunk 之间的衔接看作一个 inpainting 问题。
具体来说,设推理延迟为 d 个控制步(controller timestep)。当新 chunk 开始生成时,旧 chunk 还在继续执行。到新 chunk 可用时,前 d 个动作已经执行完毕了——所以这 d 个动作应该被「冻结」为旧 chunk 的值。剩下的 H − d 个动作需要被「补全」,且必须与冻结的前缀保持一致。这恰好是扩散模型和 flow matching 擅长的图像 inpainting 的翻版——给定一幅被 mask 掉部分区域的图像,模型要补全缺失的像素,且补全内容必须与未 mask 区域自然衔接。
RTC 在 flow matching 的去噪过程中引入伪逆引导(ΠGDM):每一步去噪时,在速度场 v 上叠加一个梯度修正项,将生成结果拉向已知的冻结前缀。团队还加入了引导权重裁剪(β),防止去噪步数较少时出现不稳定。
但仅用前 d 步做 hard masking 不够——当 d 较小时,引导信号太弱,新 chunk 仍可能切换策略。于是团队引入了 soft masking:对 chunk 中间区域(第 d 步到第 H−s 步之间)施加指数衰减的注意力权重。离冻结区越远的动作,模型越可以自由地根据新观测进行调整;离冻结区越近的,则越被约束保持原策略。这种「软注意力」机制在直觉上类似:你不需要完全照搬旧计划,但也不能在几步之内急转弯。
整个系统以背景线程运行推理循环,用过去延迟的缓冲区保守预测下一次延迟,执行窗口(execution horizon)动态适应。关键属性:零重新训练,任何基于扩散或 flow matching 的 VLA 都能直接使用。
划火柴、插网线,12 个动态仿真和 6 个真机任务全面领先
论文的评测分两层:仿真基准和真机实验。
仿真层面,团队在 Kinetix 物理模拟器中构建了 12 个高动态任务——投掷、接球、平衡等,所有任务都使用力控(force-based control),不允许「暂停」。对比基线包括 naive async(无视旧 chunk 直接切换)、bidirectional decoding(BID,用拒绝采样维持连续性)和 Temporal Ensembling(TE,对多 chunk 的预测取平均)。每种方法注入 0 到 4 步的模拟延迟,每数据点跑 2048 次 rollout。
结果:RTC 在所有延迟水平上表现最优,且延迟越高,领先幅度越大。TE 在 d=0 时就表现不佳——因为仿真任务的动作分布是多模态的,有效动作的平均不一定是有效动作。BID 需要批量采样 64 个 chunk(32 个强模型 + 32 个弱模型),计算量远超 RTC,效果却更差。soft masking 的消融实验也证实了它在低延迟下的必要性:hard masking 在 d 较小时明显不如 soft masking。
真机层面,团队用 π0.5 VLA 在双臂机器人上测试了 6 个任务:划火柴点蜡烛、插以太网线、铺床(移动操作)、叠衬衫、批量叠衣、把餐具放进水槽(移动操作)。除正常延迟外,还注入了 +100ms 和 +200ms 的人工延迟,模拟更大的模型或云端推理场景。数据集总计 480 个 episode,超过 28 小时的纯机器人执行时间。
以任务吞吐量(完成任务子步骤的比例除以 episode 时长)作为核心指标:
- +0ms 延迟:RTC 优于同步推理和两种 TE 变体
- +100ms 和 +200ms:同步推理线性退化;两种 TE 变体因振荡过大触发机器人保护性停机,根本无法运行
- RTC 在 +200ms 下吞吐量完全不受影响
更关键的是精确性。在「划火柴点蜡烛」这个任务中——唯一不允许重试的任务——RTC 的最终得分大幅领先。即使在去除推理停顿后按控制器步数对比,RTC 也比同步推理更早完成更多子步骤,意味着更少的错误和更少的重试。论文还发现,得益于跨 chunk 的连续性,RTC 能够更好地利用闭环修正:执行窗口越短(反应越快),RTC 表现越好,而其他方法在短执行窗口下反而不稳定。
Cobot 的一处改动让策略「丝滑如黄油」
论文发表两个月后,机器人公司 Cobot 的研究员 Alexander Soare 发布了一篇,记录了他们在实际部署 RTC 时发现的一个细微问题——以及带来的超参数改进。
Soare 注意到,即使使用 RTC,chunk 之间仍存在难以察觉的微小不连续。他追溯到 ΠGDM 推导中的一个关键假设:先验数据分布的标准差 σ_d 被默认为 1。这个假设在图像生成中是合理的(像素被归一化到均值 0、标准差 1),但在动作轨迹生成中却是错的——给定具体观测(比如「夹爪在蓝色方块上方」),合理的动作分布远窄于整个数据集的分布。
Soare 将 σ_d 从 1 降到 0.2,效果立竿见影:chunk 切换点的位置偏差(L2 范数)显著缩小,叠餐巾任务中的动作轨迹在切换处几乎看不出断点。他的直觉解释是:更窄的先验意味着当前生成偏离目标的可能性更低,因此需要更强的引导权重来把它拉回正轨。他还发现引导权重裁剪参数 β 应该与去噪步数 n 成比例缩放(β ≈ n),这消除了一个需要手动调整的超参数。
这篇博客不仅验证了 RTC 方法的实用性,也为社区提供了可复现的部署经验。RTC 的影响力也在持续扩展:Physical Intelligence 随后发布了训练时版本的 RTC(,2025 年 12 月),用于 π0.6 的意式浓缩咖啡制作演示;ICLR 2026 收录的「Time Optimal Execution of Action Chunk Policies」也在 RTC 的基础上进一步优化了执行效率。
当 VLA 的推理延迟不再是部署障碍
RTC 瞄准的是训练与部署之间的一个分布偏移:训练数据中机器人从未停顿,但同步推理强制引入了停顿。论文通过将 chunk 衔接重述为 inpainting 问题,以零重新训练的代价消除了这个 mismatch。Physical Intelligence 已在 π0.6 中采用训练时版本的 RTC,论文讨论部分也指出,未来的机器人系统需要在多个时间尺度和抽象层次上做实时推理——暂停下来「多想一下」的能力,可能和不停顿地执行同样重要。