AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Aug 6, 2026 · Qwen3

On-Policy Delta Distillation for Multilingual Math Reasoning

What Happened

arXiv 论文《On-Policy Delta Distillation for Multilingual Math Reasoning》研究 On-Policy Distillation (OPD) 及其变体 On-Policy Delta Distillation (OPD^2) 在英语、韩语和日语数学推理中的应用。实验基于 Qwen3,OPD^2 使用教师模型与其基础模型之间的概率差作为学习信号,在韩语和日语上表现优于 OPD,并缩小了英语-韩语性能差距。英语-only OPD 也能提升韩语和日语性能,但常使响应偏向英语。

EVENT STORY

Development

  1. First ReportOn-Policy Delta Distillation for Multilingual Math ReasoningarXiv cs.CL
  2. Current Assessment该研究为多语言模型的后训练提供了新思路,可能影响多语言 AI 产品的开发。OPD^2 在非英语语言上的改进表明,蒸馏方法可以成为强化学习的替代方案,尤其适用于资源较少的语言。这或推动更多多语言模型采用类似技术,以提升非英语用户的服务质量。Agent Pulse · analysis
What Changed

该论文探讨了 On-Policy Distillation (OPD) 在多语言数学推理中的有效性,并提出了改进版本 On-Policy Delta Distillation (OPD^2)。OPD^2 利用后训练教师模型与其基础模型之间的概率差作为学习信号,在 Qwen3 上针对英语、韩语和日语进行实验。结果显示,OPD^2 在韩语和日语上显著优于 OPD,并缩小了英语-韩语性能差距。此外,英语-only 的 OPD 也能提升韩语和日语性能,但会导致响应偏向英语,凸显了多语言数据在保持目标语言响应中的重要性。

How the Capability Boundary Shifted

OPD^2 的核心创新在于使用教师模型与基础模型之间的概率差作为蒸馏信号,而非直接模仿教师输出。这种方法可能更有效地传递教师模型的后训练知识,同时减少对教师输出的过度拟合。实验表明,在多语言场景下,OPD^2 能更好地平衡语言性能,但英语-only 训练会导致语言偏移,提示多语言数据对保持目标语言响应至关重要。

Why It Matters

该研究为多语言模型的后训练提供了新思路,可能影响多语言 AI 产品的开发。OPD^2 在非英语语言上的改进表明,蒸馏方法可以成为强化学习的替代方案,尤其适用于资源较少的语言。这或推动更多多语言模型采用类似技术,以提升非英语用户的服务质量。

Who It Affects

对于提供多语言 AI 服务的公司,OPD^2 可能降低提升非英语性能的成本,因为蒸馏通常比强化学习更高效。这有助于改善非英语市场的用户体验,扩大产品覆盖范围,并可能减少对昂贵多语言数据的依赖。

What to Watch Next

未来可验证的信号包括:OPD^2 在其他语言和模型上的复现结果,以及其与强化学习在更广泛任务上的对比。若 OPD^2 被广泛采用,可能看到多语言模型在非英语语言上的性能提升,以及蒸馏方法在行业中的普及。