$β$-OPSD: Deriving with Policy Optimization, Training with Self-Distillation
论文《β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation》提出β-OPSD方法,将vanilla OPSD视为β=1的特例,通过引入可调参数β控制KL惩罚权重,推导出最优策略为参考策略与特权教师之间的几何插值,并用蒸馏近似优化。
Development
- First Report$β$-OPSD: Deriving with Policy Optimization, Training with Self-DistillationarXiv cs.LG
- Current Assessment该方法为推理语言模型的训练提供了更稳定的正则化手段,可能降低工程调优成本,推动OPSD类方法在更广泛场景中的应用,但需进一步验证其在不同模型和任务上的泛化性。Agent Pulse · analysis
论文指出,on-policy self-distillation (OPSD) 在提升推理语言模型时存在脆弱性,需要大量工程调优。作者发现vanilla OPSD是β=1的特例,通过引入可调参数β,将KL惩罚从隐式固定值变为可控正则化参数,形成更通用的β-OPSD框架。该框架的最优策略是参考策略与特权教师之间的几何插值,直接强化学习优化成本高且方差大,因此作者将闭式解转化为蒸馏目标,通过混合token级logits实现不同β对应的目标,用廉价蒸馏近似优化。
β-OPSD将OPSD的KL惩罚参数化,使β从固定值变为可调正则化参数,最优策略为参考策略与教师策略的几何插值。通过混合token级logits实现蒸馏目标,避免直接RL的高方差,为推理模型训练提供更稳定的路径。
该方法为推理语言模型的训练提供了更稳定的正则化手段,可能降低工程调优成本,推动OPSD类方法在更广泛场景中的应用,但需进一步验证其在不同模型和任务上的泛化性。
对于训练推理模型的团队,β-OPSD可能减少调参工作量,提升训练稳定性,从而降低研发成本,加速模型迭代。
后续可关注β-OPSD在更大规模模型和多样化推理任务上的实证效果,以及其与直接RL方法的性能对比,验证其实际收益。