How Closely Do LLM Reviews Align with Human Peer Review?
arXiv 论文 2608.03659v1 对比了 OpenAI GPT-5.4、Google Gemini 3.1 Pro Preview 和 Anthropic Claude Opus 4.6 生成的评审与人类评审及 ICLR 2026 的 300 篇主题匹配投稿(oral、poster、rejected 各占三分之一)的最终决定。每个模型使用相同指令和评分标准评审每篇论文,且决策信息已移除。研究发现所有三个 LLM 都能区分被接受和被拒绝的论文,但都无法复现人类评分中 oral 与 poster 的区别。Gemini 评分系统性偏高,OpenAI 和 Claude 对 rejected 和 poster 论文更接近人类,但对 oral 论文更严格。
Development
- First ReportHow Closely Do LLM Reviews Align with Human Peer Review?arXiv cs.AI
- Current AssessmentLLM 评审工具在学术会议中可能被采用,但需注意提供商偏差和细粒度区分能力不足。研究提示自动评审系统需要针对特定决策层级进行校准,并可能影响会议评审流程的设计。Agent Pulse · analysis
一项研究评估了三个 LLM 提供商(OpenAI GPT-5.4、Google Gemini 3.1 Pro Preview、Anthropic Claude Opus 4.6)在 ICLR 2026 的 300 篇投稿上生成的评审与人类评审和最终决定的吻合度。所有模型使用相同指令和评分标准,且决策信息已移除。结果显示所有 LLM 都能区分被接受和被拒绝的论文,但无法复现人类对 oral 与 poster 的区分。Gemini 评分系统性偏高,OpenAI 和 Claude 对 rejected 和 poster 论文更接近人类,但对 oral 论文更严格。研究还分析了推荐量表使用差异和识别弱点的主题一致性。
LLM 评审在粗粒度接受/拒绝分类上有效,但在细粒度区分(如 oral vs poster)上失效,表明模型可能依赖表面特征而非深层质量信号。评分分布存在提供商特定偏差,Gemini 系统性偏高,OpenAI 和 Claude 对 oral 论文更严格,这可能影响自动评审的校准。
LLM 评审工具在学术会议中可能被采用,但需注意提供商偏差和细粒度区分能力不足。研究提示自动评审系统需要针对特定决策层级进行校准,并可能影响会议评审流程的设计。
对学术会议和期刊而言,LLM 评审可辅助初步筛选,但需人工复核。对 LLM 提供商而言,评审能力可能成为差异化功能,但需解决评分偏差问题。
未来研究可能探索如何改进 LLM 评审的细粒度区分能力,或开发校准方法以匹配人类评审分布。也可能出现针对特定会议或领域的定制评审模型。