SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning
SERPO(Self-Evolving Rubric Policy Optimization)是一种用于开放式测试时强化学习(TTRL)的方法,它用闭环替代答案投票,共同演化响应证据、查询特定评分标准和策略参数。G-N-B 响应演化将最大分离的 rollout 组织成有序档案;评分标准演化保留区分这些档案的标准;概率标准评分将判定 token 似然转换为奖励信号;策略演化用所得信号优化 actor。新的 actor rollout 会刷新档案和评分标准,形成三方演化闭环。在两种模型配置、两个域内基准和四个 OOD 基准上,SERPO 在 HealthBench 和 ResearchQA 上分别提升最多 20.63 和 20.…(原文截断)。
发展脉络
- 首次出现SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement LearningarXiv cs.CL
- 当前判断SERPO 代表了测试时强化学习从封闭式任务(如数学)向开放式任务(如研究问答)的扩展。这暗示了模型在推理时自我演化的能力可能成为通用能力提升的新方向,减少对人工标注或外部奖励模型的依赖。Agent Pulse · 分析
SERPO 提出了一种新的测试时强化学习框架,专门针对开放式生成任务,这些任务中有效响应无法映射到共享的规范答案,因此传统的答案投票方法不适用。该方法构建了一个闭环,同时演化响应证据、查询特定评分标准和策略参数。具体机制包括:G-N-B 响应演化将最大分离的 rollout 组织成有序档案;评分标准演化保留能区分这些档案的标准;概率标准评分将判定 token 似然转换为奖励信号;策略演化用这些信号优化 actor。新的 actor rollout 会刷新档案和评分标准,形成持续的三方演化循环。实验在两种模型配置、两个域内基准和四个 OOD 基准上进行,结果显示 SERPO 在 HealthBench 和 ResearchQA 上分别提升最多 20.63 和 20.…(原文截断)。
SERPO 的核心创新在于用自演化评分标准替代外部奖励模型或更强评判者,从模型自身输出构建可靠奖励。这解决了开放式生成中缺乏规范答案的奖励信号问题。G-N-B 响应演化通过最大化分离的 rollout 组织档案,评分标准演化保留判别性标准,概率标准评分将 token 似然转为奖励,策略演化优化 actor。三方闭环使模型在推理时持续自我改进,无需外部反馈。
SERPO 代表了测试时强化学习从封闭式任务(如数学)向开放式任务(如研究问答)的扩展。这暗示了模型在推理时自我演化的能力可能成为通用能力提升的新方向,减少对人工标注或外部奖励模型的依赖。
SERPO 可能降低开放式 AI 应用中对人工反馈和奖励模型的需求,从而降低开发和运营成本。对于需要处理开放式任务的 AI 产品,这可能带来更高效的推理时优化。
后续可验证信号包括:SERPO 在更多开放式基准上的表现、与其他 TTRL 方法的对比、以及该方法在真实产品中的部署效果。