On-Policy Self-Distillation without Any Supervision
U-OPSD 是一种无需外部监督的 on-policy 自蒸馏方法,通过多数投票构建伪解,并蒸馏到模型最长错误补全的前缀,在 AIME24、AIME25、HMMT25、MATH500 和 AMC23 上平均提升 8.5% 和 10.7%(Qwen3 非思考模型)。
发展脉络
- 首次出现On-Policy Self-Distillation without Any SupervisionarXiv cs.LG
- 行业反馈On-Policy Self-Distillation without Any SupervisionHugging Face Daily Papers
- 当前判断U-OPSD 表明,无需外部监督的自我改进是可行的,这可能降低对高质量标注数据和大型教师模型的依赖,从而降低后训练成本。这可能会影响 LLM 后训练的方法论,推动更多无监督或自监督技术的发展。Agent Pulse · 分析
U-OPSD 是一种新的无监督 on-policy 自蒸馏方法,仅使用模型自身生成的数据,通过内部一致性实现自我改进。它采样多个 rollout,通过多数投票和自一致性阈值构建伪解,然后以最短伪解为教师分布,蒸馏到模型最长错误补全的前缀,使模型在自信错误处自我纠正。在多个基准(AIME24、AIME25、HMMT25、MATH500、AMC23)上,U-OPSD 一致优于基础模型,并匹配或超越使用真实标签的监督方法(如 OPSD 和 GRPO)。例如,在 Qwen3 非思考模型上,平均提升 8.5% 和 10.7%。
U-OPSD 的关键在于利用模型自身的内部一致性信号(多数投票)作为伪标签,并通过条件化教师分布(最短伪解)蒸馏到错误补全的前缀,实现精确的自我纠正。这种方法消除了对外部监督(如真实标签、环境反馈或更大模型)的依赖,使自蒸馏成为真正的'自我'蒸馏。
U-OPSD 表明,无需外部监督的自我改进是可行的,这可能降低对高质量标注数据和大型教师模型的依赖,从而降低后训练成本。这可能会影响 LLM 后训练的方法论,推动更多无监督或自监督技术的发展。
U-OPSD 可能降低 LLM 后训练的成本,减少对人工标注和外部教师模型的依赖,从而加速模型迭代并降低部署成本。对于提供模型训练服务的公司,这可能带来成本优势。
未来,U-OPSD 可能扩展到更多模型和任务,并与其他自监督方法结合。可验证的下一信号包括:在更多基准上的独立复现、在更大模型上的应用,以及是否被主流训练框架采用。