Same Attention, Different Truths: Put Logit-Lens over Visual Attention to Detect and Mitigate LVLM Object Hallucination
arXiv 论文 2608.07302v1 发现,LVLM 中真实与幻觉对象在模型中间到后期层都获得同等强度的视觉注意力。通过 Logit Lens 解码高注意力区域的视觉特征,真实对象可正确解码为目标对象 token,而幻觉对象不能。论文识别出两种幻觉机制:视觉不确定性(由语义相似或易混淆区域触发,掩蔽这些区域可消除幻觉)和上下文先验(由强共现先验触发,即使掩蔽初始关注区域,幻觉仍持续并转移注意力)。基于此提出无需训练的 Detect-Mitigate 框架,包含 Logit-Lens 一致性检查。
发展脉络
- 首次出现Same Attention, Different Truths: Put Logit-Lens over Visual Attention to Detect and Mitigate LVLM Object HallucinationarXiv cs.AI
- 当前判断该研究为 LVLM 幻觉检测提供了新的可解释性方法,可能影响多模态模型的可信度评估。未来可观察该方法是否被集成到主流 LVLM 的评估基准或部署流程中。Agent Pulse · 分析
这篇 arXiv 论文挑战了 LVLM 对象幻觉源于视觉注意力不足的普遍假设。作者发现,在模型中间到后期层,真实和幻觉对象都获得同等强度的视觉注意力,因此关键问题不在于注意力多少,而在于模型关注什么以及为何关注。通过 Logit Lens 解码高注意力区域的视觉特征,他们观察到真实对象区域能正确解码为目标对象 token,而幻觉对象区域则不能。基于此,他们识别出两种幻觉机制:视觉不确定性(由语义相似或易混淆区域触发,掩蔽这些区域可消除幻觉)和上下文先验(由强共现先验触发,即使掩蔽初始关注区域,幻觉仍持续并转移注意力)。基于这些发现,他们提出一个简单且无需训练的 Detect-Mitigate 框架,包含 Logit-Lens 一致性检查,用于检测和缓解幻觉。
Logit Lens 可用于解码视觉注意力高亮区域的语义内容,从而区分真实与幻觉对象。这提供了一种无需训练的诊断工具,可解释 LVLM 幻觉的机制。未来可验证的方向:该一致性检查能否在多种 LVLM 架构上泛化,以及能否与现有解码策略结合以实时抑制幻觉。
该研究为 LVLM 幻觉检测提供了新的可解释性方法,可能影响多模态模型的可信度评估。未来可观察该方法是否被集成到主流 LVLM 的评估基准或部署流程中。
对于依赖 LVLM 视觉问答的 To B 场景(如医疗影像、自动驾驶),减少幻觉可提升系统可靠性,降低错误成本。该框架无需训练,便于快速集成。
后续可关注该 Detect-Mitigate 框架在更大规模模型上的效果,以及是否出现基于该机制的训练策略。