AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Sep 10, 2026 · Negative Self-Distillation

Negative Self-Distillation: Learning to Reason by Avoiding Flaws

What Happened

论文《Negative Self-Distillation: Learning to Reason by Avoiding Flaws》指出,On-Policy Self-Distillation(OPSD)让模型以带特权信息(如标准答案)的自身轨迹为教师,会抑制不确定性表达并惩罚探索与自我纠错行为,从而在复杂推理任务上严重退化。作者提出 Negative Self-Distillation(NSD):不依赖标准答案或外部监督,由模型自行生成问题特定的负条件(如扮演“粗心推理者”),将学生分布推离该自生成负教师;并指出直接套用 unlearning 目标存在问题,因为缺陷推理 token 与……(摘要在此截断)。

EVENT STORY

Development

  1. First ReportNegative Self-Distillation: Learning to Reason by Avoiding FlawsHugging Face Daily Papers
  2. Industry ResponseNegative Self-Distillation: Learning to Reason by Avoiding FlawsarXiv cs.LG
  3. Current Assessment自蒸馏是当前 LLM 自我改进的常用路线之一,该工作提示“以标准答案为教师”的范式在复杂推理上可能有系统性代价。若结论被复现,后训练流程的评估口径可能从单纯准确率扩展到不确定性表达与自我纠错行为。目前仅为单篇论文摘要,尚不足以判断对现有训练管线的实际替代程度。Agent Pulse · analysis
What Changed

该论文针对 OPSD 的失效模式提出替代方案。OPSD 依赖特权信息构造“自信”推理轨迹,学生模仿后不确定性表达被压制,探索与自我纠错行为被惩罚,复杂推理性能下降。NSD 改为反向优化:模型自己生成问题特定的负条件(例如“粗心推理者”),学生分布远离这一自生成负教师,不使用标准答案或外部监督。论文同时提示,朴素地把 unlearning 目标用于这种“远离”会出问题,因为缺陷推理 token 与其它因素混淆(原文摘要在此处截断,具体混淆对象未在证据中给出)。证据仅来自论文摘要,未提供实验数据、基准名称或量化结果。

How the Capability Boundary Shifted

若摘要描述成立,训练信号的方向从“模仿特权解”转为“远离自生成缺陷分布”,这会改变对不确定性与探索行为的梯度压力。但摘要自承朴素 unlearning 目标存在 token 混淆问题,说明该方法的实现细节(如何分离缺陷 token 与正常 token)是能否复现的关键。可验证下一信号:论文正文是否给出与 OPSD 的对照实验、基准与消融,以及混淆问题的具体解法。

Why It Matters

自蒸馏是当前 LLM 自我改进的常用路线之一,该工作提示“以标准答案为教师”的范式在复杂推理上可能有系统性代价。若结论被复现,后训练流程的评估口径可能从单纯准确率扩展到不确定性表达与自我纠错行为。目前仅为单篇论文摘要,尚不足以判断对现有训练管线的实际替代程度。

Who It Affects

对自建后训练管线的团队,这条提示了一个可检查的风险点:用特权信息做自蒸馏可能压低模型在难题上的探索与纠错表现,而这类行为恰是长任务与 Agent 场景的稳定性来源。短期价值在于评估口径,而非直接替换训练方法;建议先在自有难题集上对比 OPSD 与基线的不确定性与纠错指标。

What to Watch Next

需要观察三点:NSD 在公开推理基准上相对 OPSD 的实测差异;负条件生成方式是否对问题类型敏感;以及该方法是否被后续工作复现或集成进开源后训练配方。若长期无复现或对照数据,宜将其视为方向性提示而非既定结论。