AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Aug 14, 2026 · LMCache

checkpoint-pre-snapshot-20260813: [Feat][CacheBlend] Recurrent-state hybrid support on the v3 blend server

What Happened

LMCache 发布 checkpoint-pre-snapshot-20260813,为 CacheBlend 添加对 Mamba2/GDN 混合模型(NemotronH 系列)的循环状态支持。新增 AuxBlobStore 存储按内容指纹索引的辅助 blob,支持混合模型的 KV 缓存组处理,解耦 v3 检索与存储流量,并改进指纹卫生。测量显示每次请求检索停滞减少 450-1145 毫秒。

EVENT STORY

Development

  1. First Reportcheckpoint-pre-snapshot-20260813: [Feat][CacheBlend] Recurrent-state hybrid support on the v3 blend serverLMCache
  2. Current AssessmentLMCache 作为开源缓存层,正在为混合架构(如 Mamba2/GDN)提供生产级支持,这表明行业对非 Transformer 架构的推理优化需求正在增长。通过将循环状态缓存纳入标准缓存框架,LMCache 降低了混合模型部署的复杂性,可能加速此类模型在长上下文场景中的应用。这也反映了缓存系统从单一注意力 KV 向多模态状态(如循环状态)演进的趋势。Agent Pulse · analysis
What Changed

LMCache 在 2026 年 8 月 13 日发布 checkpoint-pre-snapshot-20260813,为 CacheBlend 添加对 Mamba2/GDN 混合模型(NemotronH 系列)的循环状态支持。由于循环状态层不能丢弃行,混合模型需要从与 KV 一起存储的每 token 辅助平面重建完整序列。该版本新增 AuxBlobStore,作为不透明按块辅助 blob 存储,键与 KV 对象相同的内容指纹,并作为合成引擎组(cb.aux_pool)遵循相同的存储/检索计划。KV 缓存组处理:CacheBlend 连接器通过 set_cb_owned_mamba() 声明对 Mamba/GDN 组的所有权(配置驱动,无环境门控);LMCache 仅服务全注意力组,并停止拒绝非对齐的 mamba 缓存模式。v3 检索与存储流量解耦:将跨请求屏障限定为一个事件,在检索拥有的池中暂存检索(共享临时槽是存储收集的暂存区,每个请求后占用数秒),并在检索拥有的流上运行散射。仅共同生效;测量显示每次请求检索停滞减少 450-1145 毫秒。指纹卫生:拒绝索引完全被已注册内容覆盖的块窗口(任何对齐),因为覆盖副本会携带中毒的 a…

How the Capability Boundary Shifted

该版本解决了混合架构(如 Mamba2/GDN)中循环状态层的缓存难题:由于循环状态不能像注意力 KV 那样按行丢弃,缓存必须存储每 token 的辅助平面以重建完整序列。AuxBlobStore 的设计将辅助数据与 KV 对象解耦,但使用相同的内容指纹,使得存储和检索计划可以统一。将 v3 检索与存储流量解耦,通过将检索暂存到独立池并仅在检索拥有的流上运行散射,减少了跨请求屏障的阻塞,实测每次请求减少 450-1145 毫秒停滞。指纹卫生规则防止索引被完全覆盖的块窗口,避免中毒副本。这些改动共同为混合模型提供了高效的缓存服务路径。

Why It Matters

LMCache 作为开源缓存层,正在为混合架构(如 Mamba2/GDN)提供生产级支持,这表明行业对非 Transformer 架构的推理优化需求正在增长。通过将循环状态缓存纳入标准缓存框架,LMCache 降低了混合模型部署的复杂性,可能加速此类模型在长上下文场景中的应用。这也反映了缓存系统从单一注意力 KV 向多模态状态(如循环状态)演进的趋势。

Who It Affects

对于使用混合架构(如 NemotronH)的团队,该缓存支持可减少每次请求的检索停滞 450-1145 毫秒,直接降低推理延迟,提升用户体验。对于提供长上下文服务的厂商,这有助于降低单位任务成本,提高竞争力。开源实现使得该能力可被广泛采用,可能推动混合模型在产业界的落地。

What to Watch Next

后续可验证信号包括:LMCache 是否正式发布支持混合模型的稳定版本,以及是否被主流推理框架(如 vLLM)集成。此外,可观察混合模型在长上下文任务中的推理吞吐量是否因缓存优化而提升,以及是否有更多模型采用 Mamba2/GDN 混合架构。