Faster but Different: Diagnosing and Controlling Content Drift in Accelerated Multimodal Diffusion Language Models
arXiv 论文 2607.29079v1 研究训练无关加速的扩散多模态大语言模型(dMLLMs)在服务时的一致性。在 300 张真实图像上比较 Fast-dLLM 与未加速输出的内容漂移。发现置信度阈值调整不改变基线一致性,而状态刷新和图像交换干预表明陈旧视觉和生成文本状态是漂移因素。缩短 KV 缓存刷新间隔在 1.3 倍加速下实现近乎精确的一致性。dLLM-Cache 和 LaViDa 也出现类似诊断,但 dLLM-Cache 需收紧两个缓存才恢复一致性,失去速度优势。50 个低一致性对中一半存在真实内容替换。
Development
- First ReportFaster but Different: Diagnosing and Controlling Content Drift in Accelerated Multimodal Diffusion Language ModelsarXiv cs.CL
- Current Assessment该研究为加速推理的可靠性提供了诊断方法,表明训练无关加速可能引入内容漂移,影响部署安全性。对于追求低延迟的推理服务,需在加速与一致性间权衡,并考虑缓存刷新策略。这或推动更严格的一致性测试标准。Agent Pulse · analysis
该论文针对扩散式多模态大语言模型(dMLLMs)在训练无关加速下的内容漂移问题,进行了系统性诊断与控制研究。实验基于 300 张真实图像,比较 Fast-dLLM 加速输出与未加速输出的差异。研究发现,在长文本设置下(每步提交 1.05-1.25 个 token),置信度阈值调整仅改变解码行为,不改变基线一致性。通过状态刷新消融和图像交换干预,识别出陈旧视觉状态和生成文本状态是漂移的主要来源。缩短 KV 缓存刷新间隔可带来单调的速度-一致性前沿,在 1.3 倍加速下实现近乎精确的一致性。该诊断在 dLLM-Cache 和 LaViDa 中同样出现,但 dLLM-Cache 需同时收紧两个缓存才能恢复一致性,从而失去速度优势。独立提示和图像复现了阈值不敏感和刷新恢复现象。针对性审计发现,50 个低一致性对中一半存在真实内容替换。
该研究揭示了加速推理中内容漂移的机制:陈旧状态(视觉和文本)是主要因素,而非解码阈值。缩短 KV 缓存刷新间隔可有效恢复一致性,但需权衡速度。dLLM-Cache 的案例表明,仅优化部分缓存可能不足以恢复一致性,需全局考虑。这提示加速方法需关注状态一致性,而非仅解码策略。
该研究为加速推理的可靠性提供了诊断方法,表明训练无关加速可能引入内容漂移,影响部署安全性。对于追求低延迟的推理服务,需在加速与一致性间权衡,并考虑缓存刷新策略。这或推动更严格的一致性测试标准。
对于提供多模态推理服务的厂商,该研究提示加速可能带来内容不一致风险,影响用户体验和合规性。采用缓存刷新优化可在保持速度的同时提升一致性,降低服务风险。
未来可探索自适应缓存刷新策略,根据内容动态调整刷新间隔,以在速度和一致性间取得更好平衡。同时,需在更多模型和任务上验证漂移诊断的普适性,并开发自动化审计工具。