AREX Feed Article
自验证 RL 突破长时域瓶颈:WorldCycle 将视频世界模型状态漂移降低 44%,复合动作准确率提升近 4 倍
可逆动作循环本身就是无需标注的监督信号。
交互式视频世界模型正在支撑具身智能、自动驾驶和游戏模拟等长时域任务,但它们有一个致命的缺陷:让模型"向前走一步、再向后退一步",它回不到原点。
这个"最小健全性检查"暴露了自回归视频生成模型在长时域推演中误差不断累积的根本问题。更棘手的是,对于任意动作序列,不存在一个真实的未来状态可以用来度量误差——这就是验证瓶颈(verification bottleneck)。没有参照,就没办法惩罚漂移。
来自香港科技大学、武汉大学和腾讯视频 AI 技术中心的联合团队在 8 月 4 日发布到 arXiv 的论文中,提出了 WorldCycle,一种自验证强化学习框架,利用可逆动作循环(reversible action cycles)的代数性质——一个动作序列与其逆序列复合后,解析上必须回到初始状态——将其转化为无需任何标注的长时域监督信号。在同步发布的 CycleBench 基准测试中,WorldCycle 将状态回归漂移(state-returning drift)降低了最多 44%,复合动作准确率较基线模型提升了近 4 倍。显示发布日期为 8 月 4 日。
论文标题:WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models 论文链接: 项目主页: 核心成绩:状态回归漂移最高降低 44%,复合动作准确率提升近 4 倍,同时发布首个状态回归一致性诊断基准 CycleBench
两个 reward 如何迫使模型学会"状态算子"而非"记忆时序模式"
WorldCycle 直接面对三个具体挑战。
挑战一:验证瓶颈。 交互式视频世界模型以自回归方式生成未来帧——每一帧的预测结果成为下一帧的上下文。即便单步误差很小,长时域推演中的累积效应也会让画面逐渐偏离物理一致性。然而,对于一段任意的开环动作序列,训练时不存在可参照的未来真值,因此长时域误差无法被直接度量和惩罚。已有的 RL 后训练方法(如 WorldCompass)只能优化单段 clip 内的动作跟随质量,对长程空间漂移几乎无能为力。
挑战二:reward 稀疏。 即使利用"闭环应回到起点"这一物理约束,仅靠终点信号也提供不了足够的梯度来定位中间步骤的误差——这就是 reward sparsity 问题。一段 200 步的往返应该在终点重合,但究竟是哪一步开始走偏的?只靠终点比较,模型无从得知。
挑战三:时序漂移。 在自回归推演中,同一个动作(如"向左转 30°")在第 10 帧和第 200 帧执行时产生的位移可能完全不同。这是因为前序帧中的累积误差改变了模型的内部状态表征,导致相同指令产生不一致的效果——论文称之为 temporal drift。
WorldCycle 的核心洞察是:既然可逆闭环在解析上必须恒等,那么闭环内部每一对镜像帧都应该重合。这就像让一个人走一条折返路径——不仅仅是起点和终点要一致,途中每一个"去程第 i 步"和"回程第 i 步"对应的位置也应该相同。团队据此设计了两个互补的 trajectory-level reward:
空间闭环 reward(spatial closure reward)。 对于一段前向动作序列和它的精确逆序构成的闭环,第 i 个前向帧和第 (2m−i) 个反向帧理论上应处于同一状态。WorldCycle 对每一对镜像帧计算基于稠密点追踪的位移距离,在整个 rollout 的每一个中间深度都施加闭合约束,将原本稀疏的终点信号转化为密集的逐段可验证检查。直觉类比:与其只检查一个长跑运动员是否回到了起跑线,不如在跑道的每一个折返点都放一个计时器——立刻就知道他在哪一段开始掉速了。
时序一致性 reward(temporal state consistency reward)。 空间闭环保证单次循环内部的状态一致,但不保证同一个循环跑第二次时,每次经过相同阶段的状态仍然保持一致。为捕捉这种漂移,WorldCycle 将同一闭环重复执行 K 次,将所有后续循环中相同相位的帧与首次循环的对应帧进行比较。直觉类比:同一个体操动作做两次,不仅每次收尾要站稳,中间每个分解动作在两次执行中也应该落在同一位置——如果第二次的倒立姿势明显比第一次歪了,说明模型的状态表征正在发生系统性的偏移。
两个 reward 共同作用,迫使模型将动作学习为一致的状态转移算子(state operator),而非记忆特定的时序模式。论文在实现层面还引入了三项关键设计:预热-联合调度(先用空间 reward 训练 300 步让单次闭环"站稳",再激活时序 reward,且两者此后始终保持联合优化以避免灾难性遗忘)、多尺度循环采样(在 2 的不同幂次级上构造层次化闭环,防止模型学会"数步数"而非真正理解动作的逆关系),以及基于 DiffusionNFT 风格的轨迹级优化目标(仅对末尾 chunk 反向传播以控制显存成本)。
复合动作(composite action)的泛化能力值得特别关注。像"边前进边转弯"这样的复合操控,在预训练数据中几乎看不到对应的真值视频,因此基线 WorldPlay 在复合动作上的准确率从简单动作的 0.635 暴跌至 0.136(5 倍衰减)。WorldCycle 的处理方式直接而有效:复合动作的闭环同样满足解析恒等——前进一步并右转,再后退一步并左转,理论上也应回到起点。不需要任何真值视频,仅凭闭环 reward 就能优化这些 out-of-distribution 的组合动作。论文对此给出了形式化分析:闭环优化本质上在降低局部转移残差沿轨迹的累积,使模型恢复底层的动作组合代数,而非记忆特定轨迹。
CycleBench 四档测试:短、中、长时域与复合动作全面压制
论文同步发布了 CycleBench,首个专门诊断视频世界模型状态回归一致性的基准。此前的评测只关心"模型是否跟随了当前动作",而 CycleBench 追问"模型诱导的状态转移系统是否闭环一致"。
CycleBench 包含 47 条动作轨迹 × 380 帧初始画面,覆盖四类任务:
- T1 可逆闭环:前进后原路返回,检测去程-回程对称性;
- T2 闭合环路:走一条不原路后退但净位移为零的路径(如矩形绕圈),检测终点闭合;
- T3 重复闭环:同一闭环重复多次,追踪误差在各轮之间的增长;
- T4 级联闭环:两个不同结构的闭环串联,检测前序残差是否污染后续动作。
每类任务在四个设定下评估:短时域(125 帧)、中时域(253 帧)、长时域(381 帧),以及等长但出域的复合动作场景(125 帧)。
WorldCycle 在所有指标、所有时域设定上均超越 WorldCompass,且优势随推演长度扩大。关键数据如下(加权平均,对比基线 WorldCompass):
| 设定 | ESC ↓ | RPS ↓ | RCS ↓ | 动作准确率 ↑ | 视觉质量 ↑ |
|---|---|---|---|---|---|
| 短时域 125 帧 | 0.026(↓32%) | 0.019(↓44%) | 0.020(↓23%) | 0.833 | 11.24 |
| 中时域 253 帧 | 0.038(↓21%) | 0.028(↓28%) | 0.018(↓28%) | 0.878 | 10.81 |
| 复合动作 125 帧 | 0.057(↓22%) | 0.042(↓29%) | 0.026(↓35%) | 0.553(↑11%) | 10.42 |
| 长时域 381 帧 | 0.163(↓13%) | 0.087(↓16%) | 0.049(↓34%) | 0.095 | 10.31 |
ESC(Endpoint State Closure)衡量终点帧与起始帧的距离;RPS(Reverse-Path Symmetry)衡量去程-回程镜像帧的平均距离;RCS(Repeated-Cycle Stability)衡量重复执行中同相位帧的漂移程度。三个指标均为越低越好,使用独立的 RoMa 稠密匹配器计算,与训练中使用的 CoTracker reward 解耦。
短时域下 RPS 降低 44% 是最突出的单项成绩。长时域下 RCS 降低 34% 则是相对提升最大的指标,直接体现了时序一致性 reward 对长程稳定性的贡献。在复合动作场景中,WorldCycle 的动作准确率达到 0.553,是基线 WorldPlay(0.136)的 4 倍,也超出 WorldCompass(0.499)11 个百分点。
三个消融实验的发现
消融实验(Table 2)确认了几项结论:
两个 reward 各管一摊,不可替代。 仅用空间 reward 时,长时域 ESC 从 0.163 升至 0.212,复合动作准确率从 0.553 降至 0.473;仅用时序 reward 更糟——模型在所有设定上都大幅退步,因为单次闭环还未"站稳"就被要求跨循环对齐,梯度变成了噪声。
预热-联合调度不可省。 Joint-from-scratch(两个 reward 从头一起训练)全面劣于预热方案;Sequential(先空间后只时序)则会在切换后丢失空间约束,出现灾难性遗忘。论文指出,两个 reward 之间存在依赖关系:空间闭环为时序对齐提供了几何基础,两者联合优化时梯度互相增强而非竞争。
闭环训练不牺牲画面质量。 WorldCycle 在复合动作场景下的 HPSv3 视觉质量评分达到 10.42,较基线 WorldPlay(8.98)提升了 16%。论文将此归因于 reward 组合中视觉质量项(R_HPS)和动作跟随项(R_act)提供的约束,防止了闭环 reward 被视觉退化捷径满足。
消融实验还揭示了另一个结论:更大模型不等于更闭环一致。 Lingbot World v2 拥有 14B 参数,是参数量最大的对比模型,其 HPSv3 画质确实最高,但 ESC / RPS / RCS 三项闭环指标比 WorldCycle 差 1.4–8.3 倍。单纯扩大模型规模无法自动解决状态回归一致性问题。
把动作代数的结构约束变成无标注监督
WorldCycle 解决的问题超出了单一 benchmark 范围。它的核心思路是:在交互式世界模型中,动作程序本身的代数结构可以转化为训练信号。可逆动作的"组合后恒等"属性是物理世界的基本法则,不依赖于场景内容、初始状态或人工标注,却提供了对长时域推演正确性的精确验证。
论文将未来工作指向近似可逆性(approximate reversibility)和机器人操控等其他动作模态的扩展。