The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation
arXiv 论文《The Physics of Multi-Turn Long-Horizon Planning》提出了一个统一的多轮环境,用于系统研究长程规划能力在预训练和后训练阶段的获取与塑造。研究发现:显式世界模型构建(通过 CoT 状态转换建模)能增强长程泛化;原子技能不足以实现组合泛化,少量长程数据即可;次优轨迹会严重损害性能,因为误差在长程中放大。后训练阶段(GRPO 和 OPD)存在三个应用区域:不必要、有效和不可行。
发展脉络
- 首次出现The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic DistillationarXiv cs.AI
- 当前判断该工作为 Agent 训练提供了可操作的指导:预训练数据中应包含显式状态转换的 CoT 数据,并避免次优轨迹;后训练应针对通用规划模式而非任务特定知识。这可能导致 Agent 训练范式的转变,从大规模无监督预训练转向更结构化的数据设计。Agent Pulse · 分析
arXiv 论文《The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation》引入了一个统一可控的多轮环境,用于研究基础模型智能体的长程规划能力。在预训练阶段,研究发现显式世界模型构建(通过链式思维状态转换建模)比隐式学习更能提升长程泛化;原子技能单独不足以实现组合泛化,但少量长程数据即可显著改善;次优轨迹会因误差累积而严重损害性能。在后训练阶段,通过互信息区分通用规划模式与任务特定规划知识,并识别出后训练的三种应用区域:不必要、有效和不可行。
该研究揭示了长程规划能力的关键机制:显式世界模型构建(CoT 状态转换)是预训练中获取长程泛化的核心,而原子技能的组合泛化需要少量长程数据作为“种子”。后训练阶段(GRPO/OPD)的效果取决于规划模式与任务知识的分离,存在有效区域和不可行区域。
该工作为 Agent 训练提供了可操作的指导:预训练数据中应包含显式状态转换的 CoT 数据,并避免次优轨迹;后训练应针对通用规划模式而非任务特定知识。这可能导致 Agent 训练范式的转变,从大规模无监督预训练转向更结构化的数据设计。
对于构建长程 Agent 的公司,该研究提供了降低训练成本的方向:通过精心设计包含显式状态转换的少量长程数据,可能替代大量次优轨迹数据,从而减少预训练计算量。同时,后训练应聚焦于通用规划模式,避免在任务特定知识上浪费资源。
后续可验证信号:1)其他团队在类似可控环境中复现显式世界模型构建的优势;2)基于该发现设计的预训练数据在真实 Agent 任务上的性能提升;3)后训练有效区域的具体边界条件被进一步量化。