AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Jul 30, 2026 · CRPO

Contrastive Reinforced Policy Optimization via Privileged Self-Distillation

What Happened

论文提出 Contrastive Reinforced Policy Optimization (CRPO),将 agentic On-Policy Self-Distillation (OPSD) 从对比学习角度重构,利用预测熵区分正负位置,进行组内对比以保留细粒度优化信号。在 13 个推理和深度搜索基准上,CRPO 持续优于现有强化学习和自蒸馏基线,提升长程交互中的训练稳定性和泛化能力。

EVENT STORY

Development

  1. First ReportContrastive Reinforced Policy Optimization via Privileged Self-DistillationarXiv cs.LG
  2. Current Assessment该研究反映了 post-training 技术从 RLVR 向 OPSD 及对比学习演进的趋势,表明行业正寻求更稳定、更高效的训练方法以支持复杂 agent 应用。CRPO 的提出可能推动 agent 训练框架的更新,但需关注其在不同模型和任务上的泛化性。Agent Pulse · analysis
What Changed

该论文针对多轮 agentic 场景中 On-Policy Self-Distillation (OPSD) 的暴露偏差问题,提出 Contrastive Reinforced Policy Optimization (CRPO)。CRPO 从对比学习视角重构 OPSD,利用预测熵区分正位置(反思性探索)和负位置(暴露偏差),并通过组内对比保留可靠、细粒度的优化信号。在 13 个挑战性推理和深度搜索基准上的评估显示,CRPO 一致优于现有强化学习和自蒸馏基线,显著提升长程交互中的训练稳定性和泛化能力。

How the Capability Boundary Shifted

CRPO 的核心创新在于将 OPSD 的 logit 级监督转化为对比学习框架,通过预测熵区分正负样本,从而缓解暴露偏差。这暗示了在长程 agentic 任务中,细粒度的监督信号比稀疏奖励更有效,但需要精心设计对比策略。可验证的下一信号是:CRPO 在更大规模模型或更复杂 agent 任务上的表现,以及其与 RLVR 结合的效果。

Why It Matters

该研究反映了 post-training 技术从 RLVR 向 OPSD 及对比学习演进的趋势,表明行业正寻求更稳定、更高效的训练方法以支持复杂 agent 应用。CRPO 的提出可能推动 agent 训练框架的更新,但需关注其在不同模型和任务上的泛化性。

Who It Affects

对于构建 agent 产品的公司,CRPO 可能降低训练成本并提升 agent 在长任务中的可靠性,从而加速商业化落地。但需验证其在实际产品中的收益,如任务完成率和用户满意度。

What to Watch Next

未来,CRPO 可能成为 agent 训练的标准组件,与 RLVR 结合形成混合训练范式。可观察的下一信号是:CRPO 在开源模型上的复现结果,以及是否有主流训练框架集成该方法。