OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution
OpenART 是一个用于可扩展 Agent 红队测试的开放竞技场,通过环境演化实现。它提供超过 10,000 个经过验证的有状态场景,覆盖 50 个领域,源自超过 500,000 个工具和技能。任务中位数需要 97 次工具调用,支持 75 种不同的 Agent 模型配置的统一评估。OpenART 提出了 Evolutionary Markov Hypergraph Attack (EMHA),这是一种黑盒策略,通过协调授权的状态转换进行反馈驱动的环境演化,无需参数更新。评估中任务目标固定,仅环境状态变化。
发展脉络
- 首次出现OpenART: Scaling Agent Red Teaming via Open-Ended Environment EvolutionHugging Face Daily Papers
- 行业反馈OpenART: Scaling Agent Red Teaming via Open-Ended Environment EvolutionarXiv cs.CL
- 当前判断OpenART 的出现表明 Agent 安全评估正在从静态、短时任务转向动态、有状态的环境演化,这反映了行业对 Agent 长期部署风险的关注。其提供的大规模场景库和统一评估框架可能成为 Agent 安全测试的新标准,影响安全基准的制定。可验证的下一信号是:是否有第三方机构或企业采用 OpenART 作为 Agent 安全评估工具,或将其集成到 CI/CD 流程中。Agent Pulse · 分析
OpenART 论文提出了一种通过环境演化进行可扩展 Agent 红队测试的开放竞技场。传统安全基准侧重于短时静态任务,无法捕捉 Agent 在持久环境中长期交互的累积风险。OpenART 提供超过 10,000 个经过验证的有状态场景,覆盖 50 个领域,源自超过 500,000 个工具和技能,任务中位数需要 97 次工具调用,支持 75 种不同的 Agent 模型配置的统一评估。为了系统探索演化中的攻击面,论文提出 Evolutionary Markov Hypergraph Attack (EMHA),这是一种黑盒策略,通过协调授权的状态转换进行反馈驱动的环境演化,无需参数更新。评估中任务目标固定,仅环境状态变化。该工作旨在解决 Agent 安全评估中环境状态累积影响的问题。
OpenART 的核心创新在于将环境演化作为红队测试的驱动机制,通过 EMHA 黑盒策略在固定任务目标下改变环境状态,从而探索攻击面。这种方法无需更新模型参数,而是通过协调状态转换来生成新的测试场景。其规模(10,000+ 场景、50 领域、500,000+ 工具)和评估广度(75 种配置)表明,Agent 安全评估正从静态任务转向动态、有状态的环境。可验证的下一信号是:OpenART 是否会被用于评估主流 Agent 框架(如 AutoGPT、LangChain)在长时任务中的安全性,以及 EMHA 是否能发现传统基准遗漏的累积风险。
OpenART 的出现表明 Agent 安全评估正在从静态、短时任务转向动态、有状态的环境演化,这反映了行业对 Agent 长期部署风险的关注。其提供的大规模场景库和统一评估框架可能成为 Agent 安全测试的新标准,影响安全基准的制定。可验证的下一信号是:是否有第三方机构或企业采用 OpenART 作为 Agent 安全评估工具,或将其集成到 CI/CD 流程中。
对于开发 Agent 产品的企业,OpenART 提供了一种可扩展的安全评估方法,有助于在部署前发现潜在风险,降低安全事故成本。其大规模场景库和统一评估框架可能成为安全测试服务的商业基础。可验证的下一信号是:是否有安全公司或云服务商基于 OpenART 提供商业化评估服务。
未来,OpenART 可能推动 Agent 红队测试的标准化,使安全评估更贴近真实部署环境。EMHA 方法可能被扩展用于其他领域,如自动驾驶或机器人。可验证的下一信号是:OpenART 是否发布更新版本,增加更多领域或支持更多模型配置,以及是否有后续研究改进 EMHA 的效率或效果。