Refining Over Resampling: Test-Time Self-Correction for LLM Reasoning
arXiv 论文 2608.05643v1 提出一种无验证器的广度-深度细化框架,用于大语言模型推理时的测试时自校正。该方法采样多个独立推理轨迹,通过迭代自我批判与自我修正细化每条轨迹,再以多数投票聚合。在 AIME24、AIME25、AMC、OlympiadBench 和 MATH500 上,该方法在多个开源模型上一致优于贪心解码、多数投票、基于验证器的 best-of-N、beam search 和 lookahead decoding。例如,使用 Qwen2.5-1.5B,MATH500 准确率从最强验证器基线提升至 58.0%,AMC 从 25.0% 提升至 32.5%。
Development
- First ReportRefining Over Resampling: Test-Time Self-Correction for LLM ReasoningarXiv cs.CL
- Current Assessment该研究为测试时扩展提供了新方向,可能影响推理时计算资源的分配策略。无验证器方法降低了对奖励模型依赖,可能简化推理系统设计,并提升小模型在数学推理上的表现。Agent Pulse · analysis
该论文针对测试时扩展中广泛采样收益递减的问题,提出无验证器的广度-深度细化框架。方法先采样多个独立推理轨迹以保持多样性,再对每条轨迹进行迭代自我批判与自我修正以修复局部错误,最后通过多数投票聚合。实验覆盖五个数学推理基准和多个开源模型,结果显示该方法一致优于贪心解码、多数投票、验证器 best-of-N、beam search 和 lookahead decoding。以 Qwen2.5-1.5B 为例,MATH500 准确率从最强验证器基线提升至 58.0%,AMC 从 25.0% 提升至 32.5%。
该方法的核心在于将测试时计算用于探索和细化,而非仅依赖更宽的采样。广度阶段保留多样化的初始尝试,深度阶段通过自我批判与自我修正修复局部推理错误,再以多数投票聚合。这避免了外部奖励模型校准问题,同时缓解了广泛采样的收益递减。
该研究为测试时扩展提供了新方向,可能影响推理时计算资源的分配策略。无验证器方法降低了对奖励模型依赖,可能简化推理系统设计,并提升小模型在数学推理上的表现。
该方法可能降低推理成本,因为无需训练或调用外部验证器,同时提升小模型推理能力,对部署在资源受限环境的推理服务有潜在价值。
后续可验证信号包括:该方法在更多推理任务(如代码生成、逻辑推理)上的表现,以及与其他测试时扩展方法的组合效果。