HalluTruthQA-4K: A Fine-Grained Corpus and Annotation Process for Arabic Hallucination Detection and Truth Verification
HalluTruthQA-4K 是 HalluTruthQA 的扩展版本,包含 4,000 条专家精选的阿拉伯语问答实例,覆盖伊斯兰知识、历史、科学和地理四个领域。该数据集作为 HalluScoring 2026 共享任务 Track 2 的官方数据集,每条实例包含阿拉伯语问题、模型生成回答、验证过的参考答案和五个干扰项。幻觉回答额外标注了字符级错误片段、人工编写的解释和分层幻觉类型。数据集中有 1,643 条幻觉回答和 2,357 条非幻觉回答,共标注了 1,843 个错误片段。
Development
- First ReportHalluTruthQA-4K: A Fine-Grained Corpus and Annotation Process for Arabic Hallucination Detection and Truth VerificationarXiv cs.CL
- Current Assessment阿拉伯语作为低资源语言,其幻觉检测资源的缺乏限制了相关应用的质量保障。HalluTruthQA-4K 的发布填补了这一空白,为阿拉伯语 NLP 社区提供了标准化的评测基准,可能促进阿拉伯语 LLM 应用在事实准确性方面的改进。Agent Pulse · analysis
大型语言模型在生成流利的阿拉伯语回答时可能引入难以识别和验证的事实错误。现有的阿拉伯语幻觉资源通常对整个回答分配二元标签,但缺乏关于确切错误内容、错误原因或正确事实答案的详细信息。HalluTruthQA-4K 通过提供细粒度的标注来解决这一局限,包括字符级错误片段、人工解释和分层幻觉类型。该数据集包含 4,000 条专家精选的阿拉伯语问答实例,覆盖四个知识密集型领域,并作为 HalluScoring 2026 共享任务 Track 2 的官方数据集。
该数据集引入了字符级错误片段标注,这比传统的整句二元标签提供了更细粒度的幻觉定位信息。分层幻觉类型和人工编写的解释进一步支持了错误原因的分析。这种标注粒度可能推动阿拉伯语幻觉检测从粗粒度分类向细粒度定位和解释的方向发展。
阿拉伯语作为低资源语言,其幻觉检测资源的缺乏限制了相关应用的质量保障。HalluTruthQA-4K 的发布填补了这一空白,为阿拉伯语 NLP 社区提供了标准化的评测基准,可能促进阿拉伯语 LLM 应用在事实准确性方面的改进。
对于开发阿拉伯语 LLM 产品或服务的公司,该数据集提供了评测和提升模型事实准确性的基准,有助于减少幻觉带来的风险,提升用户信任和产品可靠性。
该数据集作为共享任务的一部分,预计将吸引研究社区参与阿拉伯语幻觉检测的竞争,推动更先进的检测方法出现。未来可能扩展到更多领域或语言,或引入更细粒度的标注维度。