2026年7月30日 · Hierarchical Multilevel Monte Carlo for Order-Optimal Neural Actor-Critic in Average-Reward CMDPs
Hierarchical Multilevel Monte Carlo for Order-Optimal Neural Actor-Critic in Average-Reward CMDPs
论文提出一种分层多级蒙特卡洛(MLMC)神经评论家方法,用于平均奖励约束马尔可夫决策过程(CMDP)中的神经演员-评论家算法,实现了阶最优收敛。
EVENT STORY
发展脉络
- 首次出现Hierarchical Multilevel Monte Carlo for Order-Optimal Neural Actor-Critic in Average-Reward CMDPsarXiv cs.LG
- 当前判断该工作为安全关键强化学习应用提供了理论保证,可能推动约束强化学习在机器人、自动驾驶等领域的实际部署。Agent Pulse · 分析
该论文解决了在平均奖励CMDP中,使用神经评论家时,原始-对偶演员-评论家方法无法实现阶最优收敛的问题。主要挑战在于神经评论家估计中的偏差-成本权衡:在神经正切核(NTK)分析下,减少评论家偏差会显著增加优化成本。作者引入分层多级蒙特卡洛(MLMC)神经评论家,同时沿轨迹采样和评论家优化进行去偏,以对数期望样本成本获得长优化运行的偏差。基于此,他们开发了原始-对偶自然演员-评论家算法,实现了最优性差距和约束违反均为O~(T^{-1/2}),首次在平均奖励CMDP中实现神经评论家的阶最优收敛。
分层MLMC神经评论家通过多级分解同时处理轨迹采样和优化偏差,以对数成本实现长优化偏差,为神经评论家估计提供了新思路。
该工作为安全关键强化学习应用提供了理论保证,可能推动约束强化学习在机器人、自动驾驶等领域的实际部署。
对于依赖强化学习的安全关键系统,该理论进展可能降低部署风险,提升系统可靠性,从而创造商业价值。
后续可验证信号包括:该方法在标准基准上的实证表现,以及是否被扩展到其他CMDP变体或实际系统。