Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control
POGP(Prefix-Optimal Generative Policies)框架通过在每个中间去噪步骤学习前缀价值函数,为连续控制任务引入测试时停止规则。在四个 MuJoCo 环境和 12 个基线对比中,POGP 将所需去噪迭代次数减少约 2.7 倍,同时保持接近完整的任务性能;与最先进的动态扩散基线相比,前缀训练将最终任务性能提升约 3.5%。
发展脉络
- 首次出现Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous ControlarXiv cs.LG
- 当前判断该研究为扩散模型在实时控制场景中的部署提供了成本优化路径,可能推动扩散策略在机器人、自动驾驶等对延迟敏感的应用中更广泛采用。Agent Pulse · 分析
扩散策略在连续控制中表现强大,但迭代去噪过程造成计算瓶颈。POGP 框架学习前缀价值函数,通过 Bellman 式递归在去噪链上提供辅助训练目标,并实现测试时停止规则,在额外步骤不太可能产生有意义改进时终止去噪。实验表明,POGP 在四个 MuJoCo 环境中将去噪迭代次数减少约 2.7 倍,同时保持接近完整的任务性能,并相比动态扩散基线提升最终任务性能约 3.5%。
POGP 的核心创新在于将去噪链视为可递归优化的序列,通过前缀价值函数在每个中间步骤评估当前动作质量,从而动态决定是否继续去噪。这种方法不仅降低了推理成本,还通过辅助目标改善了中间输出的质量,表明监督中间去噪步骤对最终性能有积极影响。
该研究为扩散模型在实时控制场景中的部署提供了成本优化路径,可能推动扩散策略在机器人、自动驾驶等对延迟敏感的应用中更广泛采用。
POGP 通过减少去噪迭代次数,显著降低推理计算成本,有助于提升扩散策略在实际应用中的实时性和能效,对依赖快速决策的行业具有商业价值。
未来可探索将 POGP 扩展到更复杂的控制任务和真实世界场景,并验证其在不同扩散模型架构上的泛化能力。