See2Think: Do Multimodal Models Really Use Intermediate Visual States?
See2Think 是一个统一评估框架,包含 See2ThinkBench(1200 个开放问题,覆盖 12 个任务类别)和 Visual Action-of-Thought(VAoT),用于诊断多模态大模型在推理中是否真正依赖中间视觉状态。评估发现视觉推理强烈依赖于模型和环境,没有单一设置在所有任务中占优,且忠实渲染是主要瓶颈。
发展脉络
- 首次出现See2Think: Do Multimodal Models Really Use Intermediate Visual States?arXiv cs.AI
- 当前判断该研究为多模态模型在需要视觉中间步骤的任务(如图表理解、3D 场景推理)中的部署提供了诊断工具。当前模型在视觉推理上的不一致性意味着产品化时需针对特定任务和模型组合进行调优。可验证信号:是否有公司采用类似框架进行模型选型或质量监控。Agent Pulse · 分析
多模态大语言模型在推理中越来越多地使用草图、标注、工具和中间图像,但尚不清楚它们是否真正依赖这些视觉状态。现有基准受限于任务覆盖窄或部分可文本求解的样本,且评估只关注最终答案而不诊断中间视觉状态的生成、渲染和使用。为此,研究者提出 See2Think,一个统一评估框架,包含 See2ThinkBench(1200 个开放问题,12 个任务类别,涵盖 2D 结构化、3D 场景和真实世界推理)和 Visual Action-of-Thought(VAoT),后者在四种受控推理设置下记录文本思维、视觉动作、渲染状态和后续推理。评估代表性专有和开源多模态模型发现,视觉推理强烈依赖于模型和环境,没有单一设置一致占优;过程分析显示模型通常选择相关视觉操作,但忠实渲染仍是清晰瓶颈。
See2Think 通过 VAoT 的四种推理设置(无视觉、仅视觉、视觉+文本、完全)揭示了多模态模型在中间视觉状态使用上的差异。关键发现是模型能选择相关视觉操作,但渲染环节的忠实度不足,导致视觉状态未能有效辅助推理。这提示未来研究需关注渲染质量与推理对齐的联合优化。可验证信号:后续工作是否提出针对渲染忠实度的训练方法或评估指标。
该研究为多模态模型在需要视觉中间步骤的任务(如图表理解、3D 场景推理)中的部署提供了诊断工具。当前模型在视觉推理上的不一致性意味着产品化时需针对特定任务和模型组合进行调优。可验证信号:是否有公司采用类似框架进行模型选型或质量监控。
对于构建多模态应用(如文档分析、设计辅助)的团队,该框架提供了评估模型是否真正利用视觉信息的工具,有助于避免部署后因视觉推理不可靠导致的用户体验问题。可验证信号:是否有企业将 See2Think 纳入模型评估流程。
See2Think 框架可扩展至更多任务和模型,推动多模态推理评估标准化。渲染瓶颈的解决可能催生新的模型架构或训练策略。可验证信号:See2ThinkBench 是否被后续研究用作基准,以及 VAoT 设置是否被集成到模型训练中。