AdvPlan-Bench: Adversarial Evaluation of Structured Plan-Generation Agents
AdvPlan-Bench 是一个用于对抗性评估结构化计划生成智能体的离线基准。它引入了一种通用评估对象:带类型的计划、对抗性响应集、选择器诊断和可追踪的候选前沿指标。计划表示为带可选分支的类型化动作链,分配合成质量分数,使用 BLUE-vs-RED 优势和 Nash-gap 诊断比较对立计划,并通过透明启发式规则评估定性约束一致性。在 150 个合成场景中,采样最佳响应策略将 BLUE 优势从 .518 降至 .486,BLUE 胜率从 .900 降至 .820。离线 LLM 策略契约基线达到 .496 BLUE 优势和 .700 BLUE 胜率,而两阶段多智能体委员会获得 .509 BLUE 优势和 .813 BLUE 胜率。
Development
- First ReportAdvPlan-Bench: Adversarial Evaluation of Structured Plan-Generation AgentsarXiv cs.LG
- Current Assessment该基准为计划生成智能体的评估提供了新范式,可能推动行业采用更严格的对抗性测试标准。多智能体委员会的表现表明,协作机制在对抗环境中具有潜力,可能影响未来智能体系统的设计方向。Agent Pulse · analysis
AdvPlan-Bench 引入了一个离线基准,用于对抗性评估结构化计划生成智能体。它提出了一种通用评估对象,包括带类型的计划、对抗性响应集、选择器诊断和可追踪的候选前沿指标。计划表示为带可选分支的类型化动作链,分配合成质量分数,使用 BLUE-vs-RED 优势和 Nash-gap 诊断比较对立计划,并通过透明启发式规则评估定性约束一致性。在 150 个合成场景中,采样最佳响应策略将 BLUE 优势从 .518 降至 .486,BLUE 胜率从 .900 降至 .820。离线 LLM 策略契约基线达到 .496 BLUE 优势和 .700 BLUE 胜率,而两阶段多智能体委员会获得 .509 BLUE 优势和 .813 BLUE 胜率。
该基准将对抗性评估引入计划生成,通过 BLUE-vs-RED 优势和 Nash-gap 诊断量化智能体在对抗环境中的鲁棒性。采样最佳响应策略显著降低 BLUE 优势,表明对抗性响应集能有效暴露单样本响应的脆弱性。两阶段多智能体委员会在 BLUE 胜率上优于离线基线,但 BLUE 优势略低,提示多智能体协作可能提升鲁棒性但需权衡优势。
该基准为计划生成智能体的评估提供了新范式,可能推动行业采用更严格的对抗性测试标准。多智能体委员会的表现表明,协作机制在对抗环境中具有潜力,可能影响未来智能体系统的设计方向。
该基准为计划生成智能体的开发提供了可量化的评估工具,有助于企业选择更鲁棒的智能体方案,降低部署风险。多智能体委员会的表现可能推动相关产品的商业化。
未来可能看到更多基于对抗性评估的基准出现,推动计划生成智能体在真实场景中的鲁棒性提升。多智能体协作机制可能成为提升对抗鲁棒性的重要方向。