Control Under Compression: Reliability Frontiers for Tool-Using Agents
CompressAgent 是一个环境验证的基准,用于评估工具使用语言模型代理的控制上下文(ACC)压缩。它涵盖九个独立构建的 ACC、三个任务族、三个固定的 Qwen API 模型标识符、六个保留上下文预算,以及 15,525 次运行。在 75% 保留上下文时,通用重写和基于部分的压缩分别达到 92.7% 和 92.4% 的成功率,接近 93.8% 的全上下文基线。在 35% 时,基于部分、义务感知和通用重写的成功率分别为 47.0%、39.0% 和 19.9%。在 25% 至 10% 的预算下,可执行协议变得脆弱。可靠性在不同 ACC 间差异显著。
发展脉络
- 首次出现Control Under Compression: Reliability Frontiers for Tool-Using AgentsarXiv cs.CL
- 当前判断该基准强调了压缩代理控制上下文的可靠性挑战,表明在部署压缩代理时,需要针对具体上下文进行验证,而非依赖通用压缩器。这可能导致更专业的压缩工具和评估标准出现。Agent Pulse · 分析
该论文介绍了 CompressAgent,一个用于评估工具使用语言模型代理控制上下文压缩的基准。代理不仅受任务提示控制,还受指定工具、参数、策略、执行协议和恢复的系统侧指令控制。压缩这些上下文可以降低成本,但现有评估未揭示操作可靠性。CompressAgent 在九个 ACC、三个任务族、三个 Qwen 模型、六个预算和 15,525 次运行中进行了测试。结果揭示了非线性、方法依赖的可靠性前沿:在 75% 保留时,通用重写和基于部分的压缩接近全上下文基线;在 35% 时,方法差异显著;在 25% 以下,协议变得脆弱。可靠性因 ACC 而异,表明通用压缩器排名不适用。
压缩工具使用代理的控制上下文存在可靠性前沿,不同压缩方法在不同保留预算下表现差异显著。通用重写在较高保留率下表现良好,但在较低保留率下急剧下降,而基于部分的方法更稳健。这表明压缩方法的选择应基于保留预算和上下文内容。可执行协议在低预算下变得脆弱,提示需要协议感知的压缩。
该基准强调了压缩代理控制上下文的可靠性挑战,表明在部署压缩代理时,需要针对具体上下文进行验证,而非依赖通用压缩器。这可能导致更专业的压缩工具和评估标准出现。
对于提供代理服务的公司,压缩控制上下文可以降低成本,但必须确保可靠性。该基准提供了评估压缩方法可靠性的方法,有助于选择或开发适合的压缩策略,从而在成本与可靠性之间取得平衡。
未来可能开发针对特定上下文类型的压缩方法,并建立更全面的基准,涵盖更多模型和任务。可靠性前沿的发现可能促使在压缩代理中引入自适应预算或协议感知机制。