AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Aug 4, 2026 · ChartAnno

ChartAnno: Evaluating MLLMs for Chart Annotation Generation

What Happened

ChartAnno 是一个用于评估多模态大语言模型(MLLMs)图表注释生成能力的基准,包含 1,200 个真实世界图表及配对代码和注释指令,指令具有三种特异性级别。研究评估了 10 个代表性 MLLMs,在仅图表代码和图表代码加图像两种输入设置下进行,并包含仅图像消融研究。结果显示专有模型整体更强,但大规模开源模型缩小了差距;更具体的指令提高注释质量,推断抽象意图仍是最难的;提供图表图像带来有限整体提升,主要在涉及设计的指标上。

EVENT STORY

Development

  1. First ReportChartAnno: Evaluating MLLMs for Chart Annotation GenerationarXiv cs.CL
  2. Current Assessment该基准填补了 MLLM 评估在图表注释领域的空白,为多模态模型在数据可视化场景中的应用提供了参考。专有模型与开源模型的差距缩小,可能推动更多企业采用开源模型进行图表相关任务。指令特异性对质量的影响提示,产品设计需注重用户指令的明确性。Agent Pulse · analysis
What Changed

ChartAnno 基准评估了 MLLMs 在图表注释生成任务上的能力,该任务要求模型推断图表意图并放置文本或图形元素。基准包含 1,200 个真实图表,配对不同特异性的注释指令。评估了 10 个模型,在仅代码、代码加图像以及仅图像设置下进行。结果发现专有模型整体更强,但开源模型差距缩小;更具体的指令提升质量,抽象意图推断最难;图像输入仅在设计相关指标上带来有限提升。

How the Capability Boundary Shifted

图表注释生成任务对 MLLMs 提出独特挑战,需要结合图表语义理解和意图推断。指令特异性显著影响注释质量,表明提示工程对性能有重要影响。图像输入带来的增益有限,且主要体现在设计指标上,暗示当前模型在视觉与代码信息融合上仍有局限。开源模型与专有模型的差距缩小,可能源于更大规模训练和更好的指令遵循能力。

Why It Matters

该基准填补了 MLLM 评估在图表注释领域的空白,为多模态模型在数据可视化场景中的应用提供了参考。专有模型与开源模型的差距缩小,可能推动更多企业采用开源模型进行图表相关任务。指令特异性对质量的影响提示,产品设计需注重用户指令的明确性。

Who It Affects

对于数据可视化工具和 BI 产品,图表注释自动化可提升用户效率。开源模型的进步可能降低相关功能的成本,使更多企业能够集成此类能力。

What to Watch Next

未来可能看到更多针对图表注释的专门优化,如改进意图推断能力或融合视觉与代码信息的新架构。开源模型可能进一步缩小与专有模型的差距,推动更广泛的应用。