Latent Action as Intention Enables Efficient Future Imagination for World Action Models
LAWA 是一种世界动作模型(WAM)架构,用紧凑的潜在动作作为未来意图的操作表示,在测试时无需生成未来观测即可高效想象未来。它通过动作无关预训练增强的离散分词器生成以操作为中心的码本目标,联合去噪锚定到这些目标的连续潜在状态与可执行动作块,推理时省略未来视频分支。在 RoboCasa 上,LAWA 在少样本和全数据设置下平均成功率分别达 65.6% 和 80.8%,比匹配的 Fast-WAM 基线分别提高 9.6 和 4.5 个百分点,并保持匹配的 Joint-WAM 变体的性能水平。
发展脉络
- 首次出现Latent Action as Intention Enables Efficient Future Imagination for World Action ModelsHugging Face Daily Papers
- 行业反馈Latent Action as Intention Enables Efficient Future Imagination for World Action ModelsarXiv cs.RO
- 当前判断该研究针对 WAM 中效率与泛化的权衡,Fast-WAM 牺牲泛化换取速度,而 LAWA 通过潜在动作表示兼顾两者。这可能影响机器人控制领域对模型架构的选择,推动更注重推理效率与泛化平衡的设计。可验证的下一信号是:是否有其他团队采用类似潜在动作表示方法,或在真实机器人部署中验证其效率优势。Agent Pulse · 分析
世界动作模型(WAM)通过建模观测演化来改进机器人控制,但测试时生成未来观测会带来显著延迟。Fast-WAM 移除此过程以提高效率,但匹配实现显示其泛化能力低于未来感知的替代方案,尤其在机器人演示稀缺和分布外场景中。为弥合差距,LAWA 使用紧凑潜在动作作为未来意图的操作表示,实现高效的测试时未来想象,无需生成未来观测。具体而言,动作无关预训练增强的离散分词器产生以操作为中心的码本目标,LAWA 联合去噪锚定到这些目标的连续潜在状态与可执行动作块,推理时省略未来视频分支。在 RoboCasa 上,LAWA 在少样本和全数据设置下平均成功率分别达 65.6% 和 80.8%,比匹配的 Fast-WAM 基线分别提高 9.6 和 4.5 个百分点,并保持匹配的 Joint-WAM 变体的性能水平。
LAWA 的核心创新在于用潜在动作作为未来意图的表示,避免了测试时生成未来观测的延迟,同时通过动作无关预训练增强的离散分词器提供以操作为中心的码本目标,使潜在状态锚定到这些目标。这暗示未来想象可以压缩为紧凑的潜在表示,而非显式视频生成,可能为实时机器人控制提供更高效的架构选择。可验证的下一信号是:在更多机器人操作基准或真实机器人上,LAWA 是否能在保持或提升成功率的同时显著降低推理延迟。
该研究针对 WAM 中效率与泛化的权衡,Fast-WAM 牺牲泛化换取速度,而 LAWA 通过潜在动作表示兼顾两者。这可能影响机器人控制领域对模型架构的选择,推动更注重推理效率与泛化平衡的设计。可验证的下一信号是:是否有其他团队采用类似潜在动作表示方法,或在真实机器人部署中验证其效率优势。
对于机器人控制相关企业,LAWA 可能降低实时推理延迟,提升部署效率,同时保持高成功率,有助于在少样本场景下快速适应新任务。可验证的下一信号是:是否有公司或实验室将 LAWA 集成到实际机器人产品中,并报告性能与延迟数据。
LAWA 展示了潜在动作作为意图表示在机器人控制中的潜力,未来可能进一步探索更复杂的意图表示或与其他感知模块结合。可验证的下一信号是:LAWA 是否在更多任务或真实环境中超越现有基线,以及其预训练方法是否被更广泛采用。