AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年7月31日 · ExtractBench

ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

发生了什么

ExtractBench 是一个面向企业文档 schema 引导抽取的基准,包含 370 份企业文档、4869 页、8 个业务领域和 67 种文档类型。它同时评估值准确性、记录完整性、grounding 和成本。商业 VLM 在短文档上表现良好,但在长文档上会截断记录列表;编码 agent 准确性更高但成本更高。LlamaExtract Agentic Plus 在三个指标上均排名第一。

EVENT STORY

发展脉络

  1. 首次出现ExtractBench: A Benchmark for Schema-Guided Enterprise Document ExtractionarXiv cs.AI
  2. 当前判断ExtractBench 的发布表明,企业文档抽取正从单一准确性评估转向多维度评估,包括成本。商业 VLM 在长文档上的不足可能推动企业采用更复杂的 agent 方案,或促使模型提供商优化长文档处理。LlamaExtract Agentic Plus 的领先地位可能影响企业选择,但需独立验证。Agent Pulse · 分析
改变了什么

ExtractBench 是首个同时评估值准确性、记录完整性、grounding 和成本的 schema 引导抽取基准。其评估系统包含 370 份企业文档、4869 页、8 个业务领域和 67 种文档类型,并带有挑战场景标签。基准的构建结合了独立系统一致性、合成列表已知值和人工验证表单。实验发现,商业 VLM 在短文档上表现良好,但在长文档上会截断记录列表;编码 agent 准确性更高但成本更高。LlamaExtract Agentic Plus 在三个指标上均排名第一,准确性可与编码 agent 相媲美,但成本仅为后者的一小部分。

能力边界怎么变了

ExtractBench 引入了顺序不敏感的值 F1 和词级、页级 grounding 指标,为评估抽取质量提供了更全面的方法。其数据构建流程结合了独立系统一致性、合成列表和人工验证,可能成为未来基准的参考。实验表明,长文档中的记录列表截断是当前 VLM 的明显短板,而编码 agent 虽准确但成本高,提示了在准确性和成本之间需要新的平衡。

为什么重要

ExtractBench 的发布表明,企业文档抽取正从单一准确性评估转向多维度评估,包括成本。商业 VLM 在长文档上的不足可能推动企业采用更复杂的 agent 方案,或促使模型提供商优化长文档处理。LlamaExtract Agentic Plus 的领先地位可能影响企业选择,但需独立验证。

对谁有影响

对于企业,ExtractBench 提供了选择抽取方案的依据,可帮助评估不同模型的成本效益。LlamaExtract Agentic Plus 的性价比可能吸引企业采用,但需考虑实际部署成本。基准的 grounding 指标有助于确保抽取结果的可追溯性,满足合规要求。

接下来观察

未来可能出现更多针对长文档抽取的优化,如改进的注意力机制或截断策略。基准的扩展可能涵盖更多领域和文档类型。成本与准确性的权衡可能催生新的模型或服务。