SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs
arXiv 论文 2608.03573v1 报告,SFT 在多任务训练中遭受严重任务冲突,而 RL 使不同任务稳定共存。实验表明 RL 更新稀疏且近似正交,理论分析显示 SFT 干扰受梯度范数限制,RL 干扰受梯度方差限制。作者提出 Parallel-RL 范式以解耦多任务训练。
Development
- First ReportSFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMsarXiv cs.CL
- Industry ResponseSFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMsHugging Face Daily Papers
- Current Assessment该发现可能影响多任务模型训练策略,促使从业者重新评估 SFT 和 RL 的适用场景。Parallel-RL 若被验证,可能提升训练效率,但当前仅为预印本,尚未经过同行评审。Agent Pulse · analysis
该论文通过理论和实验分析,揭示了监督微调(SFT)和强化学习(RL)在多任务学习中的不同行为。初步实验发现,SFT 在多阶段训练中遭受严重的任务冲突,而 RL 则能使不同任务稳定共存。在参数层面,RL 产生的更新是稀疏且近似正交的。理论解释基于多任务梯度干扰分析:SFT 的干扰受梯度绝对范数限制,而 RL 的干扰受梯度方差限制,该方差由优势归一化和在线策略优化引起,导致近似正交的优化方向。基于此,作者提出 Parallel-RL 范式,解耦多任务训练,提高效率和灵活性。
该研究为多任务 LLM 训练提供了理论依据:SFT 的梯度干扰受范数限制,而 RL 的干扰受方差限制,这解释了 RL 为何能实现任务共存。Parallel-RL 范式可能改变多任务训练的设计,但论文未提供具体实现细节或基准测试结果,需进一步验证。
该发现可能影响多任务模型训练策略,促使从业者重新评估 SFT 和 RL 的适用场景。Parallel-RL 若被验证,可能提升训练效率,但当前仅为预印本,尚未经过同行评审。
对于训练多任务 LLM 的团队,该研究可能提供更高效的训练范式,降低计算成本并提升模型性能,但需等待进一步验证。
后续可关注 Parallel-RL 的代码开源、在更大规模模型上的验证,以及是否被主流训练框架采纳。