GGC: Selective Query Correction for Reliable Text-to-SPARQL Generation
GGC (Generator-Gate-Corrector) 框架用于可靠的基于 LLM 的 Text-to-SPARQL 生成。它首先生成初始查询,然后通过 Gate 预测是否需要修正,仅对高风险查询调用 Corrector。在 MCQA 上,查询级准确率从 90.23% 提升到 98.33%,推理开销相比修正所有生成查询降低 45%。消融研究表明 Gate 在不同阈值下鲁棒,Corrector 训练数据组成影响修正效果和稳定性。
Development
- First ReportGGC: Selective Query Correction for Reliable Text-to-SPARQL GenerationarXiv cs.CL
- Current Assessment该框架展示了在知识图谱问答等结构化查询生成任务中,通过选择性修正可以显著提升 LLM 输出的可靠性,同时控制推理成本。这为实际部署 LLM 生成查询提供了实用方案,可能推动 Text-to-SPARQL 在工业界的应用。Agent Pulse · analysis
GGC 框架通过选择性查询修正提高 Text-to-SPARQL 生成的可靠性。LLM 生成的 SPARQL 查询可能可执行但与问题语义不匹配,导致错误检索。GGC 采用生成器-门控-修正器架构:生成器产生初始查询,门控预测是否需要修正,仅对高风险查询调用修正器,避免不必要的修改并降低破坏原本正确查询的风险。在 MCQA 基准上,GGC 将查询级准确率从 90.23% 提升至 98.33%,同时推理开销相比修正所有查询降低 45%。消融实验显示门控在不同阈值下表现鲁棒,修正器训练数据组成影响修正效果和稳定性。
GGC 引入门控机制实现选择性修正,避免对所有生成查询进行统一修正,从而在提升准确率的同时降低推理成本。门控的鲁棒性表明其预测修正需求的能力不依赖特定阈值,而修正器训练数据的组成对效果有显著影响,提示数据多样性是关键。
该框架展示了在知识图谱问答等结构化查询生成任务中,通过选择性修正可以显著提升 LLM 输出的可靠性,同时控制推理成本。这为实际部署 LLM 生成查询提供了实用方案,可能推动 Text-to-SPARQL 在工业界的应用。
GGC 通过降低推理开销和提升准确率,为知识图谱问答系统提供了更经济可靠的方案,有助于降低企业采用 LLM 进行结构化查询生成的成本,加速商业化落地。
未来可探索门控机制在其他结构化查询生成任务(如 Text-to-SQL)中的适用性,以及如何优化修正器训练数据以进一步提升效果。