Tool Specifications Matter: Uncovering and Mitigating Safety Risks in AI Agents
论文《Tool Specifications Matter: Uncovering and Mitigating Safety Risks in AI Agents》指出,schema 格式的工具规格是导致 AI agent 安全性能下降的主要原因,会削弱模型内部的拒绝信号。作者提出推理时防护措施 SafeKeep,将安全判断与工具执行解耦:用扁平化文本工具规格评估请求,同时保留原始 schema 格式规格用于执行。在两个基准和四个 LLM(包括白盒和黑盒模型)上,SafeKeep 将有害请求的平均拒绝率从 23.8% 提升至 70.6%,并将观察级提示注入下的平均攻击成功率从 25.6% 降至 2.5%,同时优于现有防护措施并保持任务处理能力。
Development
- First ReportTool Specifications Matter: Uncovering and Mitigating Safety Risks in AI AgentsarXiv cs.AI
- Industry ResponseTool Specifications Matter: Uncovering and Mitigating Safety Risks in AI AgentsHacker News · AI
- Current Assessment该研究揭示了 agent 安全风险的一个具体来源,即工具规格的格式,这为 agent 平台和工具设计提供了可操作的改进方向。SafeKeep 作为推理时防护措施,无需重新训练模型,可快速部署,对现有 agent 系统具有直接价值。Agent Pulse · analysis
AI agents 通过外部工具扩展 LLM,使其能执行复杂任务并将模型输出转化为现实行动,但部署为 agent 时安全性显著下降。论文通过白盒表征分析发现,schema 格式的工具规格是安全退化的主要来源,它削弱了模型的内部拒绝信号,导致不安全工具执行。为此提出 SafeKeep,一种推理时防护措施,将安全判断与工具执行解耦:使用扁平化文本工具规格评估请求,同时保留原始 schema 格式规格用于执行。在两个代表性基准和四个 LLM(包括白盒和黑盒模型)上,SafeKeep 将有害请求的平均拒绝率从 23.8% 提升至 70.6%,并将观察级提示注入下的平均攻击成功率从 25.6% 降至 2.5%。它优于现有防护措施,并保持任务处理能力。
SafeKeep 的核心在于将安全评估与工具执行分离,使用扁平化文本规格进行安全判断,而保留 schema 格式用于执行,这避免了 schema 格式对模型拒绝信号的削弱。其有效性表明,工具规格的表示形式直接影响模型的安全行为,为 agent 安全防护提供了新的设计思路。
该研究揭示了 agent 安全风险的一个具体来源,即工具规格的格式,这为 agent 平台和工具设计提供了可操作的改进方向。SafeKeep 作为推理时防护措施,无需重新训练模型,可快速部署,对现有 agent 系统具有直接价值。
SafeKeep 提供了一种低成本、高效的 agent 安全防护方案,可帮助企业在不牺牲任务能力的前提下降低安全风险,增强 agent 产品的可信度和合规性,对依赖 agent 自动化的行业具有商业价值。
未来可进一步探索不同工具规格格式对模型安全的影响,以及 SafeKeep 在更复杂 agent 场景中的泛化能力。此外,将 SafeKeep 与其他防护机制结合,可能进一步提升 agent 的安全性。