AI-Assisted Peer Review Across Research Communities: From Reviewer AI Policies to LLM Review Quality
一项研究调查了111个AI/NLP会议和医学期刊的审稿人AI政策,发现两个社区在监管上存在显著差异。研究在ICLR 2026和Nature Communications上评估了AI生成的同行评审,使用包含原始稿件和数百个人类及机器生成评审的新数据集,比较了开源和专有模型,采用LLM-as-a-Judge、分数对齐、粒度和与人类审稿人关注点的重叠等指标。结果显示,当前LLM能生成详细流畅的评审,但存在系统性弱点,如过度正面推荐、泛泛批评和证据基础不均衡。
Development
- First ReportAI-Assisted Peer Review Across Research Communities: From Reviewer AI Policies to LLM Review QualityarXiv cs.AI
- Current AssessmentAI辅助同行评审的采用正在增加,但不同学术社区(AI/NLP vs 医学)的监管政策差异显著,可能影响AI评审工具的开发和部署。Agent Pulse · analysis
一项研究调查了111个领先AI/NLP会议和医学期刊的审稿人AI政策,发现两个社区在监管上存在显著差异。研究在ICLR 2026和Nature Communications上评估了AI生成的同行评审,使用包含原始稿件和数百个人类及机器生成评审的新数据集,比较了开源和专有模型,采用LLM-as-a-Judge、分数对齐、粒度和与人类审稿人关注点的重叠等指标。结果显示,当前LLM能生成详细流畅的评审,但存在系统性弱点,如过度正面推荐、泛泛批评和证据基础不均衡。研究还表明,仅用总体质量分数会高估评审质量,并主张采用多维评估。
当前LLM生成的评审在流畅性和细节上表现良好,但存在系统性弱点:过度正面推荐、泛泛批评和证据基础不均衡。这表明LLM在评审任务上尚未达到人类审稿人的标准,尤其是在批判性思维和具体证据引用方面。
AI辅助同行评审的采用正在增加,但不同学术社区(AI/NLP vs 医学)的监管政策差异显著,可能影响AI评审工具的开发和部署。
对于学术出版平台和AI工具提供商,了解AI评审的局限性有助于改进产品,并可能创造新的市场机会。
未来需要开发多维评估框架来准确衡量AI评审质量,并可能推动更严格的AI评审政策制定。