SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute
SVR(Self-Verifying Refinement)是一种无外部验证器的多轮强化学习框架,模型在每轮生成解决方案、离散正确性判定和置信度分数,仅在判定为正确且置信度超过阈值时保留答案,否则基于自身验证继续细化。训练使用GRPO,固定轨迹长度,奖励促进解决方案正确性、校准感知的自我验证和可停止的正确状态;自适应停止仅在推理时激活。在七个数学推理基准上,Qwen3.5-2B模型达到宏平均准确率0.563,平均推理轮次2.99。
发展脉络
- 首次出现SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time ComputearXiv cs.AI
- 当前判断SVR代表了测试时计算自适应分配的研究方向,通过自我验证替代外部验证器,可能降低对奖励模型或验证器的依赖。这有助于提升推理效率,尤其在计算资源受限的场景下。Agent Pulse · 分析
SVR引入了一种无外部验证器的多轮强化学习框架,将自我验证作为计算控制策略。模型在每轮生成解决方案、离散正确性判定和置信度分数,仅在判定正确且置信度超过阈值时停止并保留答案,否则继续细化。训练时使用GRPO,奖励设计促进解决方案正确性、校准感知的自我验证和可停止的正确状态,自适应停止仅在推理时激活。在七个数学推理基准上,Qwen3.5-2B模型达到宏平均准确率0.563,平均推理轮次2.99。
SVR的关键创新在于将自我验证作为计算控制策略,通过联合优化正确性判定和置信度分数,实现自适应测试时计算分配。这避免了外部验证器的依赖,使模型在推理时无需真实标签即可决定是否继续细化。训练与推理的不对称性(训练固定轨迹,推理自适应停止)可能带来分布偏移,但实验表明在数学推理任务上有效。
SVR代表了测试时计算自适应分配的研究方向,通过自我验证替代外部验证器,可能降低对奖励模型或验证器的依赖。这有助于提升推理效率,尤其在计算资源受限的场景下。
SVR通过减少不必要的推理轮次,可能降低推理成本,提升响应速度,对部署大模型推理服务的公司有潜在价值。但当前仅验证于数学推理,需进一步评估在真实业务场景中的效果。
后续可关注SVR在更复杂任务(如代码生成、多步推理)上的泛化能力,以及与其他自适应计算方法的结合。可验证信号包括在更多基准上的公开评测结果或开源代码。