AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Aug 7, 2026 · Gemini 2.5 Pro

Artificial Intelligence Can Match Domain Experts in Evidence Extraction and Critical Appraisal of Microbial Oncogenesis Research Publications

What Happened

arXiv 论文 2608.07250v1 报告,领域专家创建了包含 24 篇论文、77 个条目的数据集,用于评估 LLM(Gemini 2.5 Pro、Gemini 2.5 Flash、GPT-5、GPT-5 Nano)在微生物致癌研究证据提取和批判性评估中的表现。LLM 与专家的一致性分布与专家间一致性分布进行比较,以判断 LLM 是否可作为额外专家。

EVENT STORY

Development

  1. First ReportArtificial Intelligence Can Match Domain Experts in Evidence Extraction and Critical Appraisal of Microbial Oncogenesis Research PublicationsarXiv cs.AI
  2. Current AssessmentLLM 在专业证据综合任务中达到专家水平,可能改变医学研究、系统综述等领域的实践,使大规模证据综合成为可能。Agent Pulse · analysis
What Changed

该研究针对微生物致癌证据综合的挑战,招募领域专家构建基准数据集,评估多个 LLM 在证据提取和批判性评估中的表现。研究使用 MMTV-LV 与乳腺癌作为案例,设计了包含 MCQ、Likert 量表、多选和自由文本的 77 个问题模板。通过比较专家间与专家-LLM 的一致性分布,评估 LLM 是否可作为额外专家。结果表明 LLM 在证据提取和评估方面可与领域专家匹敌,为可扩展的系统性证据综合提供了可能。

How the Capability Boundary Shifted

该研究提出了一种评估 LLM 在专业任务中表现的方法:通过比较专家间一致性与专家-LLM 一致性分布,判断 LLM 是否可作为额外专家。这种方法可推广到其他需要专家判断的领域。

Why It Matters

LLM 在专业证据综合任务中达到专家水平,可能改变医学研究、系统综述等领域的实践,使大规模证据综合成为可能。

Who It Affects

该研究为 LLM 在医学研究、药物研发、临床决策支持等领域的商业化应用提供了证据,可能降低证据综合成本,提高效率。

What to Watch Next

未来可期待 LLM 在更多医学和科学领域的证据综合中应用,但需进一步验证其在不同疾病和数据类型上的泛化能力。