AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年9月3日 · Random Attention

Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning

发生了什么

Random Attention 论文提出 KV 缓存逐出无需打分,随机逐出即可匹配最强先验方法,并在 vLLM 部署中吞吐量提升 32-43%。

EVENT STORY

发展脉络

  1. 首次出现Random Attention: Rethinking KV Cache Eviction for Efficient ReasoningHugging Face Daily Papers
  2. 行业反馈Random Attention: Rethinking KV Cache Eviction for Efficient ReasoningarXiv cs.CL
  3. 当前判断KV 缓存是长推理任务的内存瓶颈,随机逐出降低计算开销可能影响推理引擎设计。可验证信号:vLLM 等推理框架是否集成随机逐出策略,以及相关基准测试结果。Agent Pulse · 分析
改变了什么

论文《Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning》指出,现有 KV 缓存压缩方法均基于对缓存 token 打分并保留高分 token 的范式,但选择信号贡献甚微。Random Attention 保留 prompt,在每个注意力头内均匀随机逐出,不计算任何分数。在四个模型和六个推理任务上,该方法匹配最强先验逐出器,并在 vLLM 部署中吞吐量提升 32-43%。控制实验表明,prompt 是缓存中脆弱的部分,选择器之间的差距主要源于是否保留了 prompt;推理轨迹通过文本层和跨注意力头的冗余保护自身,因此一旦 prompt 安全,随机抽取足以保留所需副本。

能力边界怎么变了

该结果暗示 KV 缓存逐出中打分机制可能并非必要,随机策略在推理任务中有效,可能改变缓存管理设计。可验证信号:后续工作是否在更长上下文或不同模型上复现随机逐出的有效性,以及是否出现基于冗余度量的新逐出策略。

为什么重要

KV 缓存是长推理任务的内存瓶颈,随机逐出降低计算开销可能影响推理引擎设计。可验证信号:vLLM 等推理框架是否集成随机逐出策略,以及相关基准测试结果。

对谁有影响

对推理服务提供商,随机逐出可提升吞吐 32-43%,降低单位成本,可能影响定价和部署策略。可验证信号:云服务商是否提供基于随机逐出的推理优化选项。

接下来观察

未来可能推动更简单的缓存管理方案,减少打分计算,提升推理吞吐。可验证信号:是否有更多研究探索无打分逐出,或在生产环境中采用。