Progressive Multimodal Alignment for Continual Instruction Tuning
Progressive Multimodal Alignment (PMA) 是一个针对多模态大语言模型(MLLMs)在持续指令微调(MCIT)中投影器遗忘问题的框架。PMA 通过轻量表示描述符检测多模态分布偏移,按需渐进扩展投影器专家,并利用可扩展路由器整合专家输出,同时保留原始预训练投影器作为稳定对齐锚点。实验表明缓解投影器级遗忘能提升性能。
发展脉络
- 首次出现Progressive Multimodal Alignment for Continual Instruction TuningarXiv cs.AI
- 当前判断该工作表明,多模态持续学习中的投影器遗忘是实际部署 MLLM 的关键障碍。当前行业多聚焦于 LLM 主干的持续学习,而 PMA 提示投影器可能成为瓶颈。对于构建多模态 Agent 或持续学习系统的团队,需关注投影器的稳定性。可验证信号:是否有其他团队复现 PMA 并报告类似收益,或将其集成到开源 MLLM 框架中。Agent Pulse · 分析
多模态大语言模型(MLLMs)依赖投影器将视觉表示与语言嵌入空间对齐,但在多模态持续指令微调(MCIT)中,视觉分布变化和指令语义演化导致共享投影器漂移,引发投影器级遗忘。现有方法主要关注 LLM 主干,忽视了这一问题。本文提出 Progressive Multimodal Alignment (PMA),通过轻量表示描述符检测分布偏移,按需渐进扩展投影器专家,并利用可扩展路由器基于多模态特征整合专家输出,同时保留原始预训练投影器作为稳定对齐锚点。PMA 以亚线性参数增长平衡稳定性与可塑性,可作为现有 MCIT 方法的即插即用模块。在两个 MCIT 基准上的实验表明,缓解投影器级遗忘能带来显著提升。
PMA 的核心创新在于将投影器视为持续学习的关键瓶颈,并设计了一种渐进式专家扩展机制。其轻量表示描述符可能基于特征统计量(如均值、方差)或简单分类器,用于触发专家扩展。可扩展路由器可能采用门控网络或注意力机制,根据多模态特征动态组合专家输出。保留原始投影器作为锚点类似于弹性权重巩固或知识蒸馏,但更轻量。亚线性参数增长意味着专家数量随任务增加而缓慢增长,例如对数或平方根关系。未来可关注 PMA 在更大规模 MLLM 上的扩展性,以及描述符和路由器的具体设计细节。
该工作表明,多模态持续学习中的投影器遗忘是实际部署 MLLM 的关键障碍。当前行业多聚焦于 LLM 主干的持续学习,而 PMA 提示投影器可能成为瓶颈。对于构建多模态 Agent 或持续学习系统的团队,需关注投影器的稳定性。可验证信号:是否有其他团队复现 PMA 并报告类似收益,或将其集成到开源 MLLM 框架中。
PMA 降低了 MLLM 在持续任务中重新训练的成本,通过亚线性参数增长避免全量微调。对于提供多模态 API 或边缘设备部署的公司,可减少存储和计算开销。可验证信号:是否有云服务商或芯片公司采用类似技术优化模型更新流程。
PMA 可能推动 MLLM 在动态环境中的持续适应能力,例如机器人视觉、自动驾驶或实时多模态对话。未来方向包括:将 PMA 扩展到更多模态(如音频、触觉),或与参数高效微调方法结合。可验证信号:PMA 是否被应用于实际产品,或出现基于 PMA 的持续学习基准。