Rethinking On-Policy Distillation of Large Language Models II: One Training Example
On-policy distillation (OPD) 在单查询训练下持续提升数百步,并恢复全数据 OPD 的大部分收益。单查询达到 71.5% 的状态覆盖率,16 个查询达到 98.9% 并匹配全数据训练。
发展脉络
- 首次出现Rethinking On-Policy Distillation of Large Language Models II: One Training ExampleHugging Face Daily Papers
- 行业反馈Rethinking On-Policy Distillation of Large Language Models II: One Training ExamplearXiv cs.AI
- 当前判断该结果暗示蒸馏训练可能不需要大规模数据集,单查询或少量查询即可达到接近全数据的效果,可能降低数据收集和清洗成本。但需注意实验规模有限,且对齐速度慢可能限制实际收益。Agent Pulse · 分析
该论文研究 on-policy distillation (OPD) 中训练数据的作用,在数据最小化极限下仅用单个查询训练学生模型。实验表明,单查询 OPD 在数百步内持续改进,并跨任务域和模型家族恢复全数据 OPD 的大部分收益。通过状态覆盖率解释:单查询即可达到全数据 OPD 访问状态的 71.5%,大部分在前 100 步内;添加语义不同的查询可提高覆盖率和验证准确率,16 个查询达到 98.9% 并匹配全数据训练。然而,对齐速度在单查询和全数据训练中相似,即使固定状态集也需要数百步吸收。作者总结 OPD 是数据过喂但算法饥饿的:rollout 快速暴露广泛监督,但学生吸收监督缓慢。
OPD 的性能瓶颈可能不在数据多样性,而在学生吸收监督的算法效率。状态覆盖率指标可用于诊断训练数据是否充足:单查询已达 71.5% 覆盖率,说明数据冗余。未来可验证信号:若改进对齐算法(如调整损失或优化器)能在固定状态集上显著加速收敛,则支持算法饥饿假说。
该结果暗示蒸馏训练可能不需要大规模数据集,单查询或少量查询即可达到接近全数据的效果,可能降低数据收集和清洗成本。但需注意实验规模有限,且对齐速度慢可能限制实际收益。
对模型蒸馏实践者,该结果可能减少对大规模高质量数据集的需求,降低蒸馏成本。但需验证在更大模型和复杂任务上的可扩展性。
后续研究可能聚焦于设计更高效的对齐算法,以加速学生吸收监督,从而在数据最小化下实现更快收敛。可关注是否出现基于状态覆盖率的主动查询选择方法。