Fast and Accurate Quotation Attribution in Literary Texts
arXiv 论文《Fast and Accurate Quotation Attribution in Literary Texts》提出 encoder-based 的 joint scoring 方法,在 Project Dialogism Novel Corpus(PDNC,含 22 部英文小说、超过 35,000 条人工标注引文)上达到 94.5% 的整体归因准确率,处理速度比标准方法快 20 倍,比基于 LLM 的方法快 1000 倍以上(A100 GPU)。分析表明 joint scoring 通过保留长距离回指解析信号提升困难样本表现,该信号在预训练 encoder 中已存在。
发展脉络
- 首次出现Fast and Accurate Quotation Attribution in Literary TextsarXiv cs.CL
- 当前判断该方法表明在特定结构化任务上,encoder 模型可通过任务重构逼近 LLM 性能,同时大幅降低成本。这可能推动文学研究等领域的规模化应用,但泛化性仍需验证。Agent Pulse · 分析
arXiv 论文提出一种高效的 encoder-based 引文归因方法 joint scoring,在共享大上下文窗口中同时解析多个引文的说话者。在 PDNC 基准上达到 94.5% 准确率,速度比标准方法快 20 倍、比 LLM 方法快 1000 倍以上。该方法通过保留长距离回指信号提升困难样本表现,为大规模文学分析提供低成本方案。
joint scoring 将多个引文归因任务整合到共享上下文窗口,利用预训练 encoder 中已有的长距离回指解析信号,避免 LLM 的高计算成本。其速度优势显著,但准确率与 LLM 方法的具体差距未在摘要中量化,需关注完整论文的对比细节。
该方法表明在特定结构化任务上,encoder 模型可通过任务重构逼近 LLM 性能,同时大幅降低成本。这可能推动文学研究等领域的规模化应用,但泛化性仍需验证。
对需要大规模文本分析的机构(如出版社、学术数据库)而言,该方法可显著降低计算成本,提升处理效率,但商业化落地需考虑模型适配与数据隐私。
后续可关注该方法在其他语料或任务(如对话系统、历史文档)上的迁移效果,以及是否出现结合 LLM 与 encoder 的混合方案。