Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization
arXiv 论文 2608.23311 提出 Environment-Regularized Policy Optimization (ERPO),将策略优化的正则化从动作侧 Policy-KL 移到输入侧,引入 Query-KL (QKL) 项约束查询分布漂移,并采用数据集静态参考派生的逐查询权重。QKL 梯度仅通过查询似然流动,不直接作用于响应分布,从而保留探索。ERPO 可插入 GRPO/PPO/REINFORCE 风格流程。
Development
- First ReportBeyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy OptimizationHugging Face Daily Papers
- Industry ResponseBeyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy OptimizationarXiv cs.CL
- Current Assessment该研究可能推动 LLM 对齐和强化学习训练方法的改进,特别是在需要平衡稳定性和探索的场景中。若 ERPO 在实践中验证有效,可能被集成到主流训练框架中,影响模型训练效率和效果。Agent Pulse · analysis
arXiv 论文 2608.23311 提出 Environment-Regularized Policy Optimization (ERPO),针对 LLM 策略优化中的稳定性-探索困境。当前方法使用动作侧 Policy-KL 正则化,但它在约束响应行为的同时消耗探索预算,形成两难。ERPO 将正则化移至输入侧,引入 Query-KL (QKL) 项约束训练查询分布相对参考分布的漂移,并采用数据集静态参考派生的逐查询权重,使更新偏向参考下典型的查询。QKL 梯度仅通过查询似然流动,不包含响应得分函数,因此不直接对响应分布施加梯度压力,从而保留探索。ERPO 可插入 GRPO/PPO/REINFORCE 风格流程。
ERPO 的核心创新是将正则化从动作侧转移到输入侧,通过 Query-KL 约束查询分布漂移,同时避免对响应分布的梯度压力,从而在保持稳定性的同时保留探索。这为策略优化提供了一种新的正则化维度,可能影响 RLHF 和 RLVR 流程的设计。
该研究可能推动 LLM 对齐和强化学习训练方法的改进,特别是在需要平衡稳定性和探索的场景中。若 ERPO 在实践中验证有效,可能被集成到主流训练框架中,影响模型训练效率和效果。
对于训练 LLM 的团队,ERPO 可能提供一种更高效的正则化方法,减少调参成本并提升模型性能,从而降低训练成本或提升产品体验。
后续可关注 ERPO 在更大规模模型和不同任务上的实证结果,以及其与现有方法(如 GRPO/PPO)的对比。若效果显著,可能成为新的标准正则化方法。