GeoArbiter: Verifiability-Guided Grounding for Remote-Sensing Multimodal LLMs
GeoArbiter 是一个无需训练的管线,通过仅注入图像无法验证的地理事实来减少遥感多模态大语言模型的幻觉。在三个开源 MLLM 上,它将 fMoW 土地利用准确率提升了 12.06 至 17.19 个百分点,同时保留了全检索准确率增益的 84.69% 至 87.15%,并在源盲评审判定下将声明级幻觉降低了 9.58% 至 26.34%。
发展脉络
- 首次出现GeoArbiter: Verifiability-Guided Grounding for Remote-Sensing Multimodal LLMsarXiv cs.LG
- 当前判断该研究为遥感领域多模态模型的可靠性提供了可操作方案,可能影响地理空间分析、灾害监测等应用。它强调跨模态可验证性,可能推动模型设计从追求全知转向明确不确定性,对依赖遥感数据的行业有潜在价值。Agent Pulse · 分析
遥感多模态大语言模型经常断言图像无法证实的事实,例如设施的身份或功能。GeoArbiter 提出基于坐标的地理检索来补充缺失知识,在三个开源 MLLM 上将 fMoW 土地利用准确率提升 12.06 至 17.19 个百分点。然而,检索记录可能与可见证据冲突,模型在图像决定性时仍常遵循记录。因此,GeoArbiter 主张源信任应依赖跨模态可验证性:地理记录在图像无法验证的属性上最有用,在争议视觉可验证属性时最危险。GeoArbiter 通过仅注入图像不可验证的地理事实实现这一原则,与仲裁提示相比,内容级过滤保留了 84.69% 至 87.15% 的准确率增益,将声明级幻觉降低 9.58% 至 26.34%,并提升了对冲突记录的鲁棒性。
GeoArbiter 的核心是内容级过滤而非仲裁提示,以避免属性类型间泄漏和 yes/no 偏差。它仅注入图像无法验证的地理事实,保留大部分准确率增益并显著减少幻觉。这提示多模态模型的可信度可通过显式区分可验证与不可验证信息来提升,而非依赖模型自我判断。
该研究为遥感领域多模态模型的可靠性提供了可操作方案,可能影响地理空间分析、灾害监测等应用。它强调跨模态可验证性,可能推动模型设计从追求全知转向明确不确定性,对依赖遥感数据的行业有潜在价值。
对于遥感数据服务商或地理空间分析平台,GeoArbiter 可减少错误声明,提升决策可靠性,可能降低因幻觉导致的错误成本。它提供无需重新训练的改进,便于集成到现有系统。
未来可探索将可验证性引导应用于其他模态组合,如文本-图像或文本-音频,并可能发展出更精细的信任分配机制。可验证性标准可能成为多模态模型评估的新维度。