IslamicTurathBench: A Multi-Task, Multi-Discipline Benchmark for Evaluating Large Language Models on the Islamic Scholarly Tradition (turath)
IslamicTurathBench (ISTB) 是一个多任务、多学科数据集,用于评估大语言模型在古典伊斯兰学术(turath)上的表现。它包含 3,465 个问答项,源自 35 部公认著作,跨越 12 个多世纪的学术,涵盖伊斯兰研究的七个关键领域。ISTB 按学术需求(初级、中级、高级)和任务格式(多项选择、段落理解、开放式知识问答)两个轴构建,并包含学术人类参考小组的汇总分数和十个系统的零样本基线。
发展脉络
- 首次出现IslamicTurathBench: A Multi-Task, Multi-Discipline Benchmark for Evaluating Large Language Models on the Islamic Scholarly Tradition (turath)arXiv cs.CL
- 当前判断该基准的发布反映了 AI 行业对专业领域评估的日益重视,尤其是在宗教和文化领域。它可能推动更多针对特定文化传统的基准开发,以促进大语言模型在这些领域的可靠应用。这也表明,领域专家在基准开发中的参与对于确保质量和相关性至关重要。Agent Pulse · 分析
IslamicTurathBench (ISTB) 是一个新引入的基准,用于评估大语言模型在古典伊斯兰学术传统(turath)上的能力。该数据集由领域专家开发和审查,包含 3,465 个问答项,源自 35 部公认著作,跨越 12 个多世纪,涵盖伊斯兰研究的七个关键领域。ISTB 按学术需求(初级、中级、高级)和任务格式(多项选择、段落理解、开放式知识问答)两个轴构建,以支持对模型能力的全面剖析。它包含学术人类参考小组的汇总分数和十个系统的零样本基线,支持跨源著作、学科和学术需求的可重复评估。该基准旨在解决伊斯兰研究中缺乏高质量注释资源的问题,因为大语言模型越来越多地用于宗教和文化领域的问答、教育和研究。
ISTB 的构建表明,评估大语言模型在专业领域(如伊斯兰学术)时,需要多任务、多学科的数据集,并考虑学术需求和任务格式两个维度。其包含人类参考分数和零样本基线,为模型能力提供了可比较的基准。这提示我们,在评估模型时,应关注其在不同学科和学术需求下的表现,而不仅仅是整体准确率。
该基准的发布反映了 AI 行业对专业领域评估的日益重视,尤其是在宗教和文化领域。它可能推动更多针对特定文化传统的基准开发,以促进大语言模型在这些领域的可靠应用。这也表明,领域专家在基准开发中的参与对于确保质量和相关性至关重要。
对于开发面向宗教或文化领域应用的公司,ISTB 提供了一个评估模型能力的工具,有助于确保其产品在专业领域的准确性和可靠性。它也可能成为模型差异化竞争的一个因素,因为在该基准上表现优异的模型可能更受用户信任。
未来,ISTB 可能扩展以涵盖更多学科和语言,并可能被用于评估新模型的进步。它也可能激发其他文化或宗教传统的类似基准,从而推动大语言模型在多元文化背景下的发展。