2026年8月6日 · DASH
DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models
DASH 是一种用于推理模型的自蒸馏方法,通过自适应监督水平来改进标准 OPSD 中每个局部散度权重相同的问题。
EVENT STORY
发展脉络
- 首次出现DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning ModelsarXiv cs.AI
- 当前判断该研究反映了推理模型训练中对监督信号效率的追求,可能推动更高效的蒸馏方法,降低对大量标注数据的依赖,对模型训练成本有潜在影响。Agent Pulse · 分析
DASH 方法针对 RLVR 中奖励信号稀疏的问题,利用 OPSD 提供密集的 token 级监督,但标准 OPSD 对所有局部散度赋予相同权重,忽略了时间结构。DASH 通过映射局部蒸馏信号与序列的差距,自适应调整监督水平,以更好地利用 rollout 的时间结构。
DASH 的核心创新在于根据散度序列的历史动态调整 token 级权重,而非固定系数。这暗示了在自回归生成中,时间上下文对蒸馏效率的重要性,可能启发后续工作探索更细粒度的自适应监督策略。
该研究反映了推理模型训练中对监督信号效率的追求,可能推动更高效的蒸馏方法,降低对大量标注数据的依赖,对模型训练成本有潜在影响。
DASH 可能降低推理模型训练成本,提升蒸馏效率,对 AI 训练基础设施提供商和模型开发者有商业价值。
未来可关注 DASH 在更大规模模型上的应用效果,以及是否被集成到主流训练框架中。