ResKV: Reconstructing Omitted Attention Contributions for Fixed-Budget KV Cache Compression
ResKV 是一种用于固定预算 KV 缓存压缩的方法,它将固定 KV 预算分为精确主缓存和紧凑残差缓存,以重建被省略 token 的注意力贡献。残差条目与主缓存 token 参与相同的 softmax 归一化,恢复注意力的分子和分母。构建时验证代理确定每层和每个 KV 头的残差分配,解码时动态门控调整单个查询的残差贡献。在 LongBench 和 RULER 上进行了评估,涵盖查询感知和查询无关设置、多个骨干网络和缓存预算。
发展脉络
- 首次出现ResKV: Reconstructing Omitted Attention Contributions for Fixed-Budget KV Cache CompressionarXiv cs.CL
- 当前判断KV 缓存压缩是长上下文推理的关键,ResKV 提供了一种新方法,可能影响推理引擎的设计。其固定预算方法适合实际部署,可能推动更高效的推理服务。Agent Pulse · 分析
ResKV 提出了一种新的 KV 缓存压缩方法,通过将固定预算分为精确主缓存和紧凑残差缓存,重建被驱逐 token 的注意力贡献。该方法基于观察:缓存驱逐遗漏的信息可以表示为 softmax 注意力分子和分母中的残差统计量。ResKV 让主缓存 token 和残差条目参与相同的 softmax 归一化,从而恢复注意力的分子和分母质量,而不是作为事后修正。构建时验证代理确定每层和每个 KV 头的残差分配,解码时动态门控调整单个查询的残差贡献。在 LongBench 和 RULER 上进行了全面评估,涵盖查询感知和查询无关设置、多个骨干网络和缓存预算。
ResKV 的核心创新在于将驱逐遗漏的信息建模为 softmax 注意力中的残差统计量,并通过残差缓存恢复分子和分母。这避免了合并方法对保留键值的扰动,同时保留了驱逐方法的信息。构建时验证代理和动态门控提供了自适应分配,可能提高压缩效率。
KV 缓存压缩是长上下文推理的关键,ResKV 提供了一种新方法,可能影响推理引擎的设计。其固定预算方法适合实际部署,可能推动更高效的推理服务。
ResKV 可能降低长上下文推理的 KV 缓存内存占用,从而降低推理成本,提高吞吐量,对提供长上下文服务的公司有商业价值。
后续可关注 ResKV 在更长上下文和更大模型上的表现,以及其与现有推理框架的集成。