2026年8月6日 · RP-OPSD
RP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning Transfer
RP-OPSD 论文提出 Reasoning-Pivot-guided On-Policy Self-Distillation 方法,利用教师视图分布偏移作为代理,在 17 种语言的数学推理基准上超越强基线。
EVENT STORY
发展脉络
- 首次出现RP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning TransferarXiv cs.CL
- 当前判断该研究反映了多语言推理能力提升的持续需求,通过自蒸馏方法减少对高资源语言的依赖,可能推动低资源语言场景下的模型应用。Agent Pulse · 分析
RP-OPSD 论文针对多语言推理迁移问题,提出推理枢轴引导的在线策略自蒸馏方法。该方法通过匹配有无英文参考解的教师视图分布偏移,识别推理枢轴(推进或改变推理过程的决策),并围绕这些枢轴进行特权蒸馏和参考锚定。实验覆盖 17 种语言和多个难度级别的数学推理基准,结果显示 RP-OPSD 优于强多语言推理基线和 OPSD 变体。
RP-OPSD 的核心创新在于将推理过程分解为表面文本和推理枢轴,并利用分布偏移作为代理来定位这些枢轴,从而在自蒸馏中集中监督信号。这暗示推理能力迁移的关键可能在于决策点而非表面语言形式。
该研究反映了多语言推理能力提升的持续需求,通过自蒸馏方法减少对高资源语言的依赖,可能推动低资源语言场景下的模型应用。
对于服务多语言用户的企业,该方法可能降低多语言模型训练成本,提升低资源语言场景下的推理质量,从而改善产品体验并扩大市场覆盖。
后续可关注该方法在更多任务(如代码生成、常识推理)上的泛化,以及是否被集成到主流开源模型中。