AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Jul 31, 2026 · ExtractBench

ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

What Happened

ExtractBench 是一个面向企业文档 schema 引导抽取的基准,包含 370 份企业文档、4869 页、8 个业务领域和 67 种文档类型。它同时评估值准确性、记录完整性、grounding 和成本。商业 VLM 在短文档上表现良好,但在长文档上会截断记录列表;编码 agent 准确性更高但成本更高。LlamaExtract Agentic Plus 在三个指标上均排名第一。

EVENT STORY

Development

  1. First ReportExtractBench: A Benchmark for Schema-Guided Enterprise Document ExtractionarXiv cs.AI
  2. Current AssessmentExtractBench 的发布表明,企业文档抽取正从单一准确性评估转向多维度评估,包括成本。商业 VLM 在长文档上的不足可能推动企业采用更复杂的 agent 方案,或促使模型提供商优化长文档处理。LlamaExtract Agentic Plus 的领先地位可能影响企业选择,但需独立验证。Agent Pulse · analysis
What Changed

ExtractBench 是首个同时评估值准确性、记录完整性、grounding 和成本的 schema 引导抽取基准。其评估系统包含 370 份企业文档、4869 页、8 个业务领域和 67 种文档类型,并带有挑战场景标签。基准的构建结合了独立系统一致性、合成列表已知值和人工验证表单。实验发现,商业 VLM 在短文档上表现良好,但在长文档上会截断记录列表;编码 agent 准确性更高但成本更高。LlamaExtract Agentic Plus 在三个指标上均排名第一,准确性可与编码 agent 相媲美,但成本仅为后者的一小部分。

How the Capability Boundary Shifted

ExtractBench 引入了顺序不敏感的值 F1 和词级、页级 grounding 指标,为评估抽取质量提供了更全面的方法。其数据构建流程结合了独立系统一致性、合成列表和人工验证,可能成为未来基准的参考。实验表明,长文档中的记录列表截断是当前 VLM 的明显短板,而编码 agent 虽准确但成本高,提示了在准确性和成本之间需要新的平衡。

Why It Matters

ExtractBench 的发布表明,企业文档抽取正从单一准确性评估转向多维度评估,包括成本。商业 VLM 在长文档上的不足可能推动企业采用更复杂的 agent 方案,或促使模型提供商优化长文档处理。LlamaExtract Agentic Plus 的领先地位可能影响企业选择,但需独立验证。

Who It Affects

对于企业,ExtractBench 提供了选择抽取方案的依据,可帮助评估不同模型的成本效益。LlamaExtract Agentic Plus 的性价比可能吸引企业采用,但需考虑实际部署成本。基准的 grounding 指标有助于确保抽取结果的可追溯性,满足合规要求。

What to Watch Next

未来可能出现更多针对长文档抽取的优化,如改进的注意力机制或截断策略。基准的扩展可能涵盖更多领域和文档类型。成本与准确性的权衡可能催生新的模型或服务。