Decoupling Generation and Selection for Budget-Constrained Faithful Summarization
arXiv 论文 2608.03655v1 提出一种模块化的生成-选择框架,用于句子预算受限的摘要生成。预训练生成器生成多个候选摘要,分解为句子级候选,组合选择器在显式预算下平衡相关性、事实性和冗余度,支持 MMR、ILP 和 DPP 启发目标,无需重训生成器。在 CNN/DailyMail、Multi-News、FaithBench 和 TofuEval 上,事实性和来源接地指标一致提升,尤其在多文档摘要中,但参考重叠分数较低。人类评估显示感知一致性、相关性、清晰度和简洁性更高,连贯性略有下降。代码已公开。
发展脉络
- 首次出现Decoupling Generation and Selection for Budget-Constrained Faithful SummarizationarXiv cs.AI
- 当前判断该研究提供了一种模型无关的机制来提升摘要的事实性,可能影响摘要系统的设计范式。对于依赖摘要的行业(如新闻聚合、报告生成),这种解耦方法可能降低对生成模型本身事实性的依赖,转而通过后处理选择来保证质量。可验证的下一信号是:是否有商业摘要产品采用类似的选择后处理机制,或是否有后续工作将其扩展到其他生成任务。Agent Pulse · 分析
该论文提出一种将生成与选择解耦的模块化框架,用于句子预算受限的忠实摘要。生成器产生多个候选摘要,分解为句子级候选,选择器通过组合优化(MMR、ILP 或 DPP 启发目标)在显式预算下平衡相关性、事实性和冗余度,无需重训生成器。在 CNN/DailyMail、Multi-News、FaithBench 和 TofuEval 上的实验显示,事实性和来源接地指标一致提升,尤其多文档摘要,但参考重叠分数较低。人类评估显示感知一致性、相关性、清晰度和简洁性更高,连贯性略有下降。结果表明解耦生成与选择提供了一种模型无关的机制来改善事实接地。代码已公开。
该框架的核心在于将摘要生成分解为生成和选择两个独立阶段,选择阶段使用组合优化目标(如 MMR、ILP、DPP 启发)在显式预算下平衡相关性、事实性和冗余度。这种方法无需重训生成器,因此可以即插即用地应用于任何预训练模型。实验显示事实性指标提升,但参考重叠分数下降,表明选择过程可能牺牲了与参考摘要的词汇重叠,但提升了事实一致性。可验证的下一信号是:该框架在更大规模或更多样化的数据集上的表现,以及是否被其他研究采用。
该研究提供了一种模型无关的机制来提升摘要的事实性,可能影响摘要系统的设计范式。对于依赖摘要的行业(如新闻聚合、报告生成),这种解耦方法可能降低对生成模型本身事实性的依赖,转而通过后处理选择来保证质量。可验证的下一信号是:是否有商业摘要产品采用类似的选择后处理机制,或是否有后续工作将其扩展到其他生成任务。
对于提供摘要服务的公司,该框架提供了一种低成本提升事实性的方案,无需重训模型,可快速集成到现有流程。可能降低因摘要不忠实导致的合规风险,提升用户信任。可验证的下一信号是:是否有企业采用该框架或类似方法,并报告事实性指标的改善。
该框架可能推动摘要系统向生成-选择分离的架构演进,选择阶段可独立优化。未来可能看到更强大的选择器,或将其应用于长文档、多文档摘要。可验证的下一信号是:该框架是否被集成到主流摘要工具或库中,以及是否有研究改进选择目标以平衡更多维度。