Artificial Intelligence Can Match Domain Experts in Evidence Extraction and Critical Appraisal of Microbial Oncogenesis Research Publications
arXiv 论文 2608.07250v1 报告,领域专家创建了包含 24 篇论文、77 个条目的数据集,用于评估 LLM(Gemini 2.5 Pro、Gemini 2.5 Flash、GPT-5、GPT-5 Nano)在微生物致癌研究证据提取和批判性评估中的表现。LLM 与专家的一致性分布与专家间一致性分布进行比较,以判断 LLM 是否可作为额外专家。
Development
- First ReportArtificial Intelligence Can Match Domain Experts in Evidence Extraction and Critical Appraisal of Microbial Oncogenesis Research PublicationsarXiv cs.AI
- Current AssessmentLLM 在专业证据综合任务中达到专家水平,可能改变医学研究、系统综述等领域的实践,使大规模证据综合成为可能。Agent Pulse · analysis
该研究针对微生物致癌证据综合的挑战,招募领域专家构建基准数据集,评估多个 LLM 在证据提取和批判性评估中的表现。研究使用 MMTV-LV 与乳腺癌作为案例,设计了包含 MCQ、Likert 量表、多选和自由文本的 77 个问题模板。通过比较专家间与专家-LLM 的一致性分布,评估 LLM 是否可作为额外专家。结果表明 LLM 在证据提取和评估方面可与领域专家匹敌,为可扩展的系统性证据综合提供了可能。
该研究提出了一种评估 LLM 在专业任务中表现的方法:通过比较专家间一致性与专家-LLM 一致性分布,判断 LLM 是否可作为额外专家。这种方法可推广到其他需要专家判断的领域。
LLM 在专业证据综合任务中达到专家水平,可能改变医学研究、系统综述等领域的实践,使大规模证据综合成为可能。
该研究为 LLM 在医学研究、药物研发、临床决策支持等领域的商业化应用提供了证据,可能降低证据综合成本,提高效率。
未来可期待 LLM 在更多医学和科学领域的证据综合中应用,但需进一步验证其在不同疾病和数据类型上的泛化能力。