AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Aug 1, 2026 · CrossProjection

CrossProjection: Geometric Grounding Beyond Viewpoint Change in Architectural Drawings

What Happened

CrossProjection 是一个针对视觉语言模型在异构建筑视图(平面图、剖面图、立面图)中保持组件身份和外部化几何能力的锚定诊断基准。它通过分类判断、候选选择和自由点、线、区域定位来评估匹配、配准和几何接地。在 23 个真实绘图集和每个模型 1,954 个分类条件下,GPT-5.5 得分 82.4%,Qwen3-VL-32B-Instruct 得分 62.2%,GLM-4.5V 得分 57.2%。一项匹配的 200 目标研究交叉了自然和矢量文本抑制的绘图,并使用了封闭候选和自由几何输出。在自然绘图上,GPT 的点/区域 PCK@.05 为 54-76%,Qwen 为 8-10%,GLM 为 14-36%;线端点 PCK@.05 分别为 22%、4% 和 0%。坐标网格恢复了一些 GPT 的点/区域精度,但未恢复线条。

EVENT STORY

Development

  1. First ReportCrossProjection: Geometric Grounding Beyond Viewpoint Change in Architectural DrawingsarXiv cs.CL
  2. Current Assessment该基准为评估多模态模型在专业领域(如建筑、工程)中的几何理解能力提供了新工具。随着视觉语言模型在设计和施工中的应用增加,此类诊断对于确保模型在真实世界任务中的可靠性至关重要。Agent Pulse · analysis
What Changed

CrossProjection 论文提出了一种新的诊断基准,用于评估视觉语言模型在建筑图纸中跨异构视图(平面图、剖面图、立面图)的几何接地能力。与通常假设多视图推理中视角变化可以解释外观差异不同,建筑图纸中平面图和剖面图是切割,而立面图是投影,导致对应组件的外观变化无法用相机运动解释。该基准通过分类判断、候选选择和自由定位(点、线、区域)来评估匹配、配准和几何接地。在 23 个真实绘图集和每个模型 1,954 个分类条件下,GPT-5.5 得分 82.4%,Qwen3-VL-32B-Instruct 得分 62.2%,GLM-4.5V 得分 57.2%。一项匹配的 200 目标研究交叉了自然和矢量文本抑制的绘图,并使用了封闭候选和自由几何输出。结果显示,候选支持下的性能通常更高,但自由定位仍然脆弱:在自然绘图上,GPT 的点/区域 PCK@.05 为 54-76%,Qwen 为 8-10%,GLM 为 14-36%;线端点 PCK@.05 分别为 22%、4% 和 0%。坐标网格恢复了一些 GPT 的点/区域精度,但未恢复线条。

How the Capability Boundary Shifted

该基准揭示了视觉语言模型在几何接地方面的显著差距,尤其是在自由定位任务中。GPT-5.5 在点/区域定位上表现较好(PCK@.05 54-76%),但在线端点定位上仅 22%,而 Qwen 和 GLM 在点/区域上分别只有 8-10% 和 14-36%,线端点几乎为 0%。这表明模型在理解建筑图纸的异构视图时,缺乏对几何关系的鲁棒外部化能力。坐标网格的引入部分恢复了 GPT 的点/区域精度,但未恢复线条,暗示模型对线条的几何推理存在根本性缺陷。

Why It Matters

该基准为评估多模态模型在专业领域(如建筑、工程)中的几何理解能力提供了新工具。随着视觉语言模型在设计和施工中的应用增加,此类诊断对于确保模型在真实世界任务中的可靠性至关重要。

Who It Affects

对于建筑、工程和施工行业,该基准可帮助选择适合几何任务的模型,避免在关键任务中因模型能力不足导致错误。

What to Watch Next

未来可能看到更多针对专业领域几何推理的基准出现,以及模型在自由定位任务上的改进。可验证的下一信号是:模型在类似基准上的性能提升,或新方法专门解决线条定位问题。