Instruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-Distillation
Instruction-Conditioned Exploration (ICE) 是一种训练方法,通过在训练时向任务提示补充多种不同指令来增加尝试行为的覆盖范围。为支持 ICE,研究者提出 Asymmetric-RL/SD,一种结合强化学习和自蒸馏的训练目标,将探索到的行为转移到无条件测试时策略。在数学推理任务上,使用 ICE 与 Asymmetric-RL/SD 目标训练的 Qwen3-1.7B 在 4K 响应长度下的留出 pass@1 性能相对 DAPO 训练提升 5.0%,且在 8K 上下文下提升持续。
Development
- First ReportInstruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-DistillationarXiv cs.CL
- Current Assessment该方法可能影响 LLM 后训练流程,特别是数学推理等任务上的 RL 训练效率。可验证的下一信号是是否有其他团队采用或扩展该方法。Agent Pulse · analysis
该论文提出 Instruction-Conditioned Exploration (ICE) 方法,在训练时向任务提示补充多种不同指令,以增加 LLM 尝试行为的覆盖范围。为支持 ICE,作者提出 Asymmetric-RL/SD,一种结合强化学习和自蒸馏的训练目标,将探索到的行为转移到无条件测试时策略。实验表明,在数学推理任务上,使用 ICE 与 Asymmetric-RL/SD 目标训练的 Qwen3-1.7B 在 4K 响应长度下的留出 pass@1 性能相对 DAPO 训练提升 5.0%,且在 8K 上下文下提升持续。该方法针对 LLM 动作空间结构带来的探索挑战,利用预训练 LLM 的知识和灵活性在训练时生成多样化经验。
ICE 通过指令条件化探索增加行为覆盖,Asymmetric-RL/SD 结合强化学习和自蒸馏实现行为转移,这为 LLM 后训练中的探索-利用权衡提供了新思路。可验证的下一信号是该方法在更大模型或更复杂任务上的复现结果。
该方法可能影响 LLM 后训练流程,特别是数学推理等任务上的 RL 训练效率。可验证的下一信号是是否有其他团队采用或扩展该方法。
该方法可能降低 LLM 后训练成本并提升模型推理能力,对模型提供商有潜在价值。可验证的下一信号是是否有商业模型采用该方法。
ICE 和 Asymmetric-RL/SD 可能成为 LLM 后训练的标准组件,但需更多实验验证其泛化性。