AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Aug 2, 2026 · Practical Online KV Cache Compaction for LLM Agents: An Empirical Study

Practical Online KV Cache Compaction for LLM Agents: An Empirical Study

What Happened

arXiv 论文《Practical Online KV Cache Compaction for LLM Agents: An Empirical Study》研究 LLM 智能体的在线 KV 缓存压缩。实验表明,立即压缩通常损害性能,而延迟压缩以利用智能体的未来查询可恢复大部分差距。在 BrowseComp-Plus 和 WideSearch 上,token 驱逐(TE)在代理查询不完美时比注意力匹配(AM)更稳健。跨不同规模模型,TE 在减少 80% KV 缓存的同时保持大部分准确率,并可能提升吞吐量。

EVENT STORY

Development

  1. First ReportPractical Online KV Cache Compaction for LLM Agents: An Empirical StudyarXiv cs.CL
  2. Current Assessment该研究为 LLM 智能体的长上下文推理提供了降低 KV 缓存成本的实用方法,可能影响推理基础设施的设计。代理查询选择成为核心设计选择,提示未来系统需权衡压缩时机与查询质量。Agent Pulse · analysis
What Changed

该论文针对 LLM 智能体长轨迹推理中 KV 缓存成为推理瓶颈的问题,提出在线压缩方法。与假设静态上下文的先前方法不同,智能体需要在线压缩,即在未来相关性未知前压缩新信息,使用足够廉价的代理查询。研究将 token 驱逐(TE)和注意力匹配(AM)适配到智能体回合压缩,并比较边界、重复预填充和延迟未来生成查询等代理源。实验表明,立即压缩通常有害,而延迟压缩利用未来查询可恢复大部分性能差距;在代理不完美时 TE 比 AM 更稳健。跨模型规模,TE 减少 80% KV 缓存并保持大部分准确率,且可提升吞吐量。结果将代理查询选择定位为实际在线压缩的核心设计选择。

How the Capability Boundary Shifted

在线 KV 缓存压缩的关键在于代理查询的选择:延迟压缩以利用未来查询比立即压缩更有效,表明压缩时机与代理查询质量密切相关。TE 在代理不完美时比 AM 更稳健,可能因为 TE 对代理查询的噪声更不敏感。减少 80% KV 缓存同时保持准确率,表明在线压缩在长上下文智能体推理中具有显著潜力。

Why It Matters

该研究为 LLM 智能体的长上下文推理提供了降低 KV 缓存成本的实用方法,可能影响推理基础设施的设计。代理查询选择成为核心设计选择,提示未来系统需权衡压缩时机与查询质量。

Who It Affects

对于提供 LLM 智能体推理服务的公司,在线 KV 缓存压缩可降低推理成本并提升吞吐量,从而降低单位任务成本,提升竞争力。

What to Watch Next

后续可验证信号包括:更多研究探索延迟压缩与代理查询选择的结合;推理系统集成在线压缩以提升吞吐量;在更长轨迹和更多任务上验证 TE 的稳健性。