AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Jul 29, 2026 · Can AI agents conduct open-ended AI research? Early evidence from two case studies

Can AI agents conduct open-ended AI research? Early evidence from two case studies

What Happened

一篇 arXiv 论文报告了对两个未发表的 NeurIPS 2026 投稿进行的影子评估:让前沿 AI 代理在 6 天内、花费数千美元计算资源,尝试回答论文的核心研究问题。代理完成了所有工程任务,但未能取得实质性进展,两篇论文均被原作者明确拒绝。论文识别了五个反复出现的失败模式:对可发表研究的判断力差、对研究设计缺陷的应对缺乏创意、从死胡同中无效回溯、以及糟糕的……

EVENT STORY

Development

  1. First ReportCan AI agents conduct open-ended AI research? Early evidence from two case studiesarXiv cs.AI
  2. Industry ResponseCan AI agents conduct open-ended AI research?Hacker News · AI
  3. Current Assessment该结果对 AI 研究自动化的乐观预测构成现实检验,表明当前代理远未达到自主进行开放式 AI 研究的水平。评估方法的创新(影子评估)可能成为行业标准,用于衡量 AI 研究能力的真实进展。Agent Pulse · analysis
What Changed

一篇 arXiv 论文(2607.27191)提出了评估 AI 代理进行开放式 AI 研究能力的新方法——影子评估:让代理承担高质量未发表论文的核心研究问题,并由原作者评分。对两篇未发表的 NeurIPS 2026 投稿进行了测试,前沿代理在 6 天和数千美元计算资源下完成了所有工程任务,但未能取得实质性进展,两篇论文均被原作者明确拒绝。论文识别了五个反复出现的失败模式:对可发表研究的判断力差、对研究设计缺陷的应对缺乏创意、从死胡同中无效回溯、糟糕的……

How the Capability Boundary Shifted

当前前沿 AI 代理在开放式 AI 研究任务中表现有限,尽管能完成工程实现,但在研究判断、创意应对和回溯等核心研究能力上存在系统性缺陷。影子评估方法为衡量 AI 研究自动化进展提供了新范式,避免了窄任务评估和同行评审的局限性。

Why It Matters

该结果对 AI 研究自动化的乐观预测构成现实检验,表明当前代理远未达到自主进行开放式 AI 研究的水平。评估方法的创新(影子评估)可能成为行业标准,用于衡量 AI 研究能力的真实进展。

Who It Affects

对依赖 AI 代理自动化研发的实验室和公司而言,该结果提示当前技术尚不能替代人类研究员,研发自动化投资需谨慎。影子评估方法可作为评估代理研发能力的实用工具。

What to Watch Next

未来可关注代理在更长时间尺度、更大计算预算下的表现,以及针对识别出的失败模式进行针对性改进。影子评估方法可能被更多研究团队采用,形成基准。