OPD-V: Visual On-Policy Self-Distillation with Modality Balance
OPD-V 论文提出一种视觉 on-policy 自蒸馏方法,通过 Positive Teacher(Zoom-In Image)和 Negative Teacher(Mask Image)构造不同模态不平衡程度,发现模态平衡本身可作为特权信息,并定义 Modality-Balance Trust Region 选择 on-policy tokens 用于自蒸馏。实验覆盖 6 个基准。
发展脉络
- 首次出现OPD-V: Visual On-Policy Self-Distillation with Modality BalancearXiv cs.AI
- 当前判断该研究反映了多模态大模型后训练中对模态不平衡问题的关注,可能推动更有效的多模态推理训练方法的发展。但作为单篇论文,其影响力需后续工作验证。Agent Pulse · 分析
OPD-V 论文针对多模态大语言模型(MLLM)中 on-policy 自蒸馏(OPSD)存在的模态不平衡问题,提出一种新的视觉自蒸馏范式。现有 OPSD 方法利用多种输入来源的特权信息,但忽略了文本信息主导生成时模型无法充分整合多模态输入的问题。作者通过构造 Positive Teacher(使用 Zoom-In Image)和 Negative Teacher(使用 Mask Image)来研究模态不平衡的影响,发现模态平衡本身可以作为特权信息。基于此,OPD-V 通过 Positive Modality-Balance Logits Margins 定义 Modality-Balance Trust Region,选择用于自蒸馏的 on-policy tokens。实验在 6 个基准上进行,表明该方法能提升视觉推理能力。
OPD-V 的核心创新在于将模态平衡作为特权信息,通过对比 Positive Teacher 和 Negative Teacher 的推理正确性和 token logits,验证了模态平衡对自蒸馏的有效性。其 Modality-Balance Trust Region 机制可能为多模态自蒸馏提供新的选择标准,但具体实现细节和性能提升幅度需进一步验证。
该研究反映了多模态大模型后训练中对模态不平衡问题的关注,可能推动更有效的多模态推理训练方法的发展。但作为单篇论文,其影响力需后续工作验证。
对于开发多模态 AI 产品的公司,OPD-V 可能提供提升模型视觉推理能力的训练思路,但商业价值需结合具体产品验证。
后续可关注 OPD-V 在更多基准上的表现,以及其方法是否被其他研究采用或扩展。