Auditing Discovery Claims: A Two-Sided Criterion for Agentic Science, with the Negative Side Decidable
arXiv 论文 2608.00981v1 提出一种针对 AI-for-science 系统能力声明的双面审计标准,其负面侧可判定:无伪结(pseudoknot-free)预言机在理论上无法表示交叉碱基对,因此先前验证器的范围可在运行前被精确界定。论文用一个无求解器的算子,在它优化的预测器下解决了 60 个交叉 RNA 目标中的 43 个,而上下文无关基线为 0/60;在三个预测器下,仅 1/60 存活。在相同的 43 个目标上,该算子未见过的预测器确认了其 2 个设计,而最小自由能求解器确认了 26 个(p = 8e-7)。论文还发现,在无法被客观指标奉承的评判者下,智能体编写的程序能以更少的计算量胜过人类编写的程序。
发展脉络
- 首次出现Auditing Discovery Claims: A Two-Sided Criterion for Agentic Science, with the Negative Side DecidablearXiv cs.AI
- 当前判断该研究为 AI-for-science 领域的能力声明提供了可验证的审计方法,可能影响科研工具和智能体的评估标准。它强调了独立验证的重要性,并可能推动更严格的基准测试和验证协议。Agent Pulse · 分析
arXiv 论文 2608.00981v1 提出一种针对 AI-for-science 系统能力声明的双面审计标准,其负面侧可判定:无伪结预言机在理论上无法表示交叉碱基对,因此先前验证器的范围可在运行前被精确界定。论文用一个无求解器的算子,在它优化的预测器下解决了 60 个交叉 RNA 目标中的 43 个,而上下文无关基线为 0/60;在三个预测器下,仅 1/60 存活。在相同的 43 个目标上,该算子未见过的预测器确认了其 2 个设计,而最小自由能求解器确认了 26 个(p = 8e-7)。论文还发现,在无法被客观指标奉承的评判者下,智能体编写的程序能以更少的计算量胜过人类编写的程序。
该审计标准的关键在于负面侧的可判定性:通过证明无伪结预言机无法表示交叉碱基对,可以在运行前精确界定先前验证器的范围,从而区分真实能力提升与对易错预言机的适应。论文的实验表明,仅依赖系统自身及其预言机的统计量无法发现能力声明中的膨胀,而独立验证器能揭示显著差距。
该研究为 AI-for-science 领域的能力声明提供了可验证的审计方法,可能影响科研工具和智能体的评估标准。它强调了独立验证的重要性,并可能推动更严格的基准测试和验证协议。
对于开发 AI-for-science 工具的公司,该审计标准可能成为产品差异化的卖点,帮助建立信任。对于依赖 AI 能力声明的企业,它提供了更可靠的评估方法,降低投资风险。
未来可能看到更多基于形式化可判定性的审计标准应用于其他科学领域,以及智能体编写程序在独立评判下与人类程序的对比研究。可验证的下一信号是:更多研究采用类似的双面审计方法,或出现基于该标准的工具。