ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning
ReflectRL 论文提出从 Golden Negative Trajectories(专家模型失败轨迹)中学习,通过反思性推理和策略迁移提升大语言模型推理能力,在 9 个基准、4 个 LLM 主干和 4 种 on-policy 设置上进行了实验。
发展脉络
- 首次出现ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct ReasoningarXiv cs.AI
- 当前判断该研究可能影响 LLM 后训练范式,尤其是 on-policy 训练中数据利用效率。若有效,可减少对高质量专家轨迹的依赖,降低训练成本。但需关注其在不同模型规模和任务上的泛化性。Agent Pulse · 分析
ReflectRL 论文提出一种轻量级即插即用框架,利用专家模型在困难问题上的失败轨迹(称为 Golden Negative Trajectories)进行 on-policy 训练。传统方法丢弃这些失败轨迹,但 ReflectRL 认为它们可作为反思对象,而非模仿示范。论文识别出 Reflection Advantage:对于困难问题,反思有缺陷的轨迹比从头直接解决更容易有效。ReflectRL 首先用这些轨迹引发反思性推理,然后通过 Reflective-to-Direct Policy Transition 将推理行为迁移回直接推理。实验在 9 个基准、4 个 LLM 主干和 4 种 on-policy 设置上进行,表明该方法能提升推理能力。
ReflectRL 的核心创新在于将失败轨迹转化为训练信号,通过反思性推理利用 Reflection Advantage。其 Reflective-to-Direct Policy Transition 机制可能涉及策略蒸馏或课程学习,但论文摘要未提供细节。可验证的下一信号是论文完整版本中关于迁移机制的具体实现和消融实验。
该研究可能影响 LLM 后训练范式,尤其是 on-policy 训练中数据利用效率。若有效,可减少对高质量专家轨迹的依赖,降低训练成本。但需关注其在不同模型规模和任务上的泛化性。
对于训练 LLM 的公司,该方法可能降低后训练成本,提高模型在困难任务上的表现,从而提升产品竞争力。但需验证其实际收益。
未来可能看到 ReflectRL 方法被集成到主流训练框架,或出现类似利用失败数据的变体。可关注其开源代码和复现结果。