AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年7月29日 · HoF-Bench

HoF-Bench: Rediscovering Real AI-Discovered CVEs Without Frontier Models

发生了什么

HoF-Bench 基准基于 AISLE 公开的 95 个 AI 发现的 CVE,覆盖 8 个仓库。一个极简 LLM 分析器在严格协议下重新发现了 65 个(68%)。研究未使用前沿模型进行检测,使用了 10 个检测骨干模型。

EVENT STORY

发展脉络

  1. 首次出现HoF-Bench: Rediscovering Real AI-Discovered CVEs Without Frontier ModelsarXiv cs.LG
  2. 当前判断该研究挑战了前沿模型在漏洞发现中的必要性,表明较小的专有模型或开放权重模型可能足够。这可能影响安全工具的成本和部署策略。Agent Pulse · 分析
改变了什么

HoF-Bench 基准基于 AISLE 公开的 95 个 AI 发现的 CVE,覆盖 8 个仓库。一个极简 LLM 分析器在严格协议下重新发现了 65 个(68%)。研究未使用前沿模型进行检测,使用了 10 个检测骨干模型。

能力边界怎么变了

该基准表明,即使没有前沿模型,基于 LLM 的漏洞分析器也能在严格协议下重新发现大量真实 CVE。检测器使用固定脚手架、四次重复传递、可选生成上下文阶段和可重放的多轮分类阶段。难度与语言强相关。

为什么重要

该研究挑战了前沿模型在漏洞发现中的必要性,表明较小的专有模型或开放权重模型可能足够。这可能影响安全工具的成本和部署策略。

对谁有影响

对于安全工具供应商,该研究提供了构建经济高效漏洞检测器的证据,可能降低对昂贵前沿模型的依赖。

接下来观察

未来可能看到更多基于 LLM 的漏洞分析器采用类似基准进行标准化评估,并可能推动更高效的模型架构。