WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models
WorldCycle 是一个自验证强化学习框架,用于长时程视频世界模型。其核心思想是利用可逆动作循环:一个动作序列与其逆序列组合后必须解析地返回初始状态,从而提供无标注的长时程正确性监督。该框架构建闭合动作循环及其重复执行,并优化两个互补奖励:空间闭合奖励(强制镜像的正向和反向段之间的对称性)和时间一致性奖励(对齐重复循环执行中的状态)。这些奖励迫使模型将动作学习为一致的状态算子,而非记忆的时间模式,并能自然扩展到基础模型处理不佳的分布外复合动作循环。
发展脉络
- 首次出现WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World ModelsarXiv cs.LG
- 当前判断WorldCycle 代表了视频世界模型后训练方法的重要进展,可能推动视频生成模型在机器人、自动驾驶等需要长时程规划领域的应用。其自验证特性降低了训练数据标注成本,可能加速视频世界模型的迭代。Agent Pulse · 分析
WorldCycle 提出了一种自验证强化学习框架,用于改进长时程视频世界模型。视频世界模型在长时程规划和探索中至关重要,但存在复合误差问题。后训练方法如强化学习可以改进这些模型,但面临验证瓶颈:对于任意动作序列,不存在真实未来状态来衡量长期漂移。WorldCycle 的关键洞察是,可逆动作循环使这种验证成为可能:一个序列与其逆序列组合后必须解析地返回初始状态,从而提供无标注的长时程正确性监督。该框架构建闭合动作循环及其重复执行,并优化两个互补奖励:空间闭合奖励(强制镜像的正向和反向段之间的对称性)和时间一致性奖励(对齐重复循环执行中的状态)。这些奖励迫使模型将动作学习为一致的状态算子,而非记忆的时间模式,并能自然扩展到基础模型处理不佳的分布外复合动作循环。
WorldCycle 的核心创新在于利用动作循环的可逆性提供自监督信号,解决了视频世界模型后训练中的验证瓶颈。通过构造闭合动作循环,模型必须学习到动作作为一致状态算子的表示,而非简单的时序模式。空间闭合奖励和时间一致性奖励分别从空间和时间维度约束模型,使其在长时程预测中保持一致性。这种方法无需人工标注,可扩展到分布外的复合动作循环,可能显著提升视频世界模型在长时程规划任务中的表现。
WorldCycle 代表了视频世界模型后训练方法的重要进展,可能推动视频生成模型在机器人、自动驾驶等需要长时程规划领域的应用。其自验证特性降低了训练数据标注成本,可能加速视频世界模型的迭代。
WorldCycle 可能降低视频世界模型的训练成本,提升其长时程预测能力,从而加速其在机器人、自动驾驶等领域的商业化落地。
未来可关注 WorldCycle 在真实世界视频数据上的效果,以及其是否被集成到主流视频生成模型中。若有效,可能成为视频世界模型后训练的标准方法。