AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Jul 30, 2026 · Beyond Similarity

Beyond Similarity: Grounded Agentic Extraction and Expert-Adjudicated Evaluation of Intertextuality in Classical Chinese Histories

What Happened

arXiv 论文 2607.27595v1 提出将细粒度互文性提取重构为智能体任务:LLM 完整阅读两个文本单元,通过受限工具接口将每次复用锚定到精确字符跨度,并按五维类型标注。研究在《论语》与《汉书》的穷尽比较上验证,三位领域专家将多模型候选集裁定为 2533 对互文对。研究评估了 12 个 LLM,精确率 56%-93%,同等质量下成本差异 51 倍,并报告了置信度校准情况。

EVENT STORY

Development

  1. First ReportBeyond Similarity: Grounded Agentic Extraction and Expert-Adjudicated Evaluation of Intertextuality in Classical Chinese HistoriesarXiv cs.CL
  2. Current Assessment该研究展示了 LLM 在专业人文学科任务中的潜力,通过智能体化流程实现专家级标注。专家一致性梯度表明,需要意图推断的维度仍具挑战,限制了自动化标注的适用范围。成本差异 51 倍提示在规模化应用中需权衡模型选择。Agent Pulse · analysis
What Changed

该论文将互文性提取从相似度计算转向智能体化、可解释的抽取。作者让 LLM 通过工具接口将复用锚定到精确字符跨度,并按形式、方面、来源标记、功能、立场五维标注。在《论语》与《汉书》的穷尽比较中,专家裁定出 2533 对互文对作为基准。对 12 个 LLM 的评估显示精确率 56%-93%,成本差异 51 倍,置信度校准不一。专家一致性呈现可靠性梯度:文本表面可读的维度标注一致,而需推断意图的维度存在争议。

How the Capability Boundary Shifted

将互文性提取重构为智能体任务,要求模型通过工具接口锚定字符跨度,这比纯相似度计算更可解释。五维类型学(形式、方面、来源标记、功能、立场)提供了细粒度标注框架。12 个模型的精确率跨度大(56%-93%),且成本差异 51 倍,表明模型选择对成本效益影响显著。置信度校准的差异提示在关键应用中需谨慎使用模型置信度。

Why It Matters

该研究展示了 LLM 在专业人文学科任务中的潜力,通过智能体化流程实现专家级标注。专家一致性梯度表明,需要意图推断的维度仍具挑战,限制了自动化标注的适用范围。成本差异 51 倍提示在规模化应用中需权衡模型选择。

Who It Affects

对构建专业文本分析工具的公司,该方法提供了可解释的互文性抽取方案,可能用于文学研究、历史文献数字化等场景。成本差异 51 倍提示在预算敏感的应用中可选用低成本模型。专家裁定基准为模型评测提供了新标准。

What to Watch Next

后续可验证信号:该方法能否推广到其他古典文本对;五维类型学是否被其他研究采用;模型在意图推断维度上的表现是否随新模型提升;成本差异是否会随模型迭代缩小。