Eviction as Estimation: A Fixed-Lag Smoothing View of Test-Time Memory, and When Measuring Beats Accumulating
arXiv 论文《Eviction as Estimation: A Fixed-Lag Smoothing View of Test-Time Memory, and When Measuring Beats Accumulating》提出将语言模型工作记忆的驱逐问题重新定义为对隐藏信号(项目是否会被重用)的估计问题,并引入固定滞后平滑(fixed-lag smoothing)方法,通过等待有限步数观察模型自身对近未来预测的注意力来测量项目效用,从而决定驱逐。该方法实例化为无训练策略 RMM,是 H2O 的严格泛化。实验表明,在受控设置中,demonstrated utility 比累积注意力能更好地识别被使用的记忆,小容量记忆可表现如更大容量。
Development
- First ReportEviction as Estimation: A Fixed-Lag Smoothing View of Test-Time Memory, and When Measuring Beats AccumulatingarXiv cs.AI
- Current Assessment该工作为 LLM 推理中的 KV 缓存管理提供了新视角,可能影响推理引擎设计,但尚处于理论阶段,需进一步验证。Agent Pulse · analysis
该论文将语言模型有限工作记忆中的驱逐决策重新定义为对隐藏信号(项目是否会被重用)的估计问题,统一了现有方法(如 StreamingLLM、H2O、SnapKV)在提交滞后(commit lag H)轴上的位置:在线过滤器和学习预测器在 H=0 时提交,而 Belady 离线最优解在已知全部未来时提交。论文指出缺失的固定滞后平滑(fixed-lag smoothing)区间:等待有限步数,观察模型自身对正确近未来预测的注意力,然后才提交驱逐决策。这种测量方法(demonstrated utility)将 Belady 不可观测的未来请求转化为可从模型自身读取的信息。论文实例化为无训练策略 RMM,它是 H2O 的严格泛化,当测量均匀时退化为 H2O。在受控设置中,demonstrated utility 比累积注意力能更好地识别被使用的记忆,小容量记忆可表现如更大容量。
论文将驱逐问题形式化为估计问题,引入固定滞后平滑方法,通过等待有限步数观察模型自身注意力来测量项目效用。RMM 策略无需训练,是 H2O 的泛化。实验表明 demonstrated utility 优于累积注意力。
该工作为 LLM 推理中的 KV 缓存管理提供了新视角,可能影响推理引擎设计,但尚处于理论阶段,需进一步验证。
若 RMM 被验证有效,可降低长上下文推理的内存成本,提升推理吞吐量,对部署 LLM 的企业有直接成本效益。
后续可关注 RMM 在长上下文推理中的实际加速效果,以及是否被集成到主流推理框架中。