CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization
CoRT 是一种用于 rubric-conditioned GRPO 的 token 级信用分配方法,通过反事实重放计算 token 级对数似然对比,生成权重以重新分配 GRPO 优势,无需辅助评分器。
Development
- First ReportCoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy OptimizationarXiv cs.AI
- Current AssessmentCoRT 表明,在 RLHF 流程中,更细粒度的信用分配可以提升训练效率,而不增加模型复杂度。这可能会推动行业从响应级奖励向 token 级或 span 级奖励的转变。可验证的下一信号:是否有主流训练框架(如 TRL、DeepSpeed)集成类似方法。Agent Pulse · analysis
CoRT 提出了一种 token 级信用加权方法,用于 rubric-conditioned GRPO。它通过反事实重放,在相同采样响应下比较原始 rubric 条件提示与无标准提示的 token 级对数似然,以此作为对 rubric 上下文依赖的代理。CoRT 将这些对比映射为有界、响应归一化的权重,并用于重新分配 GRPO 优势,无需引入辅助评分器或改变响应级奖励。实验表明,CoRT 在指令调优模型和不同奖励粒度下有效。
CoRT 的核心创新在于利用反事实重放实现 token 级信用分配,无需额外训练。这解决了 GRPO 中响应级优势均匀广播的问题,使得不同标准(如格式、语义)对应的 token 能获得差异化权重。可验证的下一信号:是否有后续工作将 CoRT 扩展到多轮对话或长文本生成场景。
CoRT 表明,在 RLHF 流程中,更细粒度的信用分配可以提升训练效率,而不增加模型复杂度。这可能会推动行业从响应级奖励向 token 级或 span 级奖励的转变。可验证的下一信号:是否有主流训练框架(如 TRL、DeepSpeed)集成类似方法。
CoRT 降低了 RLHF 中细粒度奖励建模的复杂度,可能减少训练成本并提升模型对齐质量。对于提供 RLHF 服务的公司,这可以成为差异化优势。可验证的下一信号:是否有公司宣布在内部训练流程中使用 CoRT。
CoRT 为无需辅助模型的 token 级信用分配提供了新思路,未来可能被整合到 GRPO 或 PPO 变体中,成为标准组件。可验证的下一信号:CoRT 是否在开源模型(如 Llama、Mistral)的训练中被采用。