Diagnosing Fine-Grained Inconsistency Classification in Financial Disclosure Text
arXiv 论文《Diagnosing Fine-Grained Inconsistency Classification in Financial Disclosure Text》研究财务披露文本中的细粒度不一致分类。使用 SBID-FD 基准的 5940 实例快照,含 11 种不一致标签和配对参考证据跨度,比较了冻结嵌入分类器、微调编码器、证据增强分类器、提示大语言模型和 LoRA 适配生成模型。微调 300M 编码器准确率 61.9%,LoRA 适配 Qwen3.5-9B 为 61.5%,GPT-5.4 为 61.3%。作者将其解读为紧凑监督编码器的实际效率结果,而非关于模型规模的受控结论。
发展脉络
- 首次出现Diagnosing Fine-Grained Inconsistency Classification in Financial Disclosure TextarXiv cs.CL
- 当前判断财务披露审查工作流中,不一致类型识别比单纯检测冲突更有价值,因为不同类型需要不同证据和下游检查。紧凑模型达到与大型模型相当的性能,可能降低部署成本,使中小机构也能采用。可验证的下一信号:是否有金融机构在实际审查流程中采用此类分类器。Agent Pulse · 分析
arXiv 论文研究财务披露文本中的细粒度不一致分类,区分数值、时间、指称、事实和规范等不一致类型。基于 SBID-FD 基准的 5940 实例快照,在共享评估协议下比较多种模型。微调 300M 编码器达 61.9% 准确率,略高于 LoRA 适配的 Qwen3.5-9B(61.5%)和 GPT-5.4(61.3%)。作者强调这是实际效率结果,因系统在架构、监督、训练目标和输入格式上不同,不能作为模型规模的受控结论。
在细粒度不一致分类任务上,紧凑监督编码器(300M)与大规模生成模型(9B LoRA、GPT-5.4)准确率接近,表明任务可能更依赖监督信号和输入格式而非模型规模。证据增强和微调可能比单纯扩大模型更有效。可验证的下一信号:是否有更大规模编码器或更优证据增强方法突破 65% 准确率。
财务披露审查工作流中,不一致类型识别比单纯检测冲突更有价值,因为不同类型需要不同证据和下游检查。紧凑模型达到与大型模型相当的性能,可能降低部署成本,使中小机构也能采用。可验证的下一信号:是否有金融机构在实际审查流程中采用此类分类器。
对财务合规和审计行业,紧凑高效的不一致分类器可降低人工审查成本,提高审查一致性和速度。接近大型模型性能的小模型意味着更低的推理成本和更易部署,可能加速金融文本分析工具的普及。可验证的下一信号:是否有商业产品集成此类分类器并报告实际收益。
未来可能看到更多针对财务文本的专用监督模型,以及证据增强方法的改进。模型规模竞赛在特定任务上可能让位于效率和监督质量。可验证的下一信号:SBID-FD 基准是否有新版本或更大规模,以及是否有新模型刷新准确率。