AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年8月3日 · llama.cpp

b10236

发生了什么

llama.cpp 发布 b10236 版本,实现了 DSv4 Lightning Indexer 和 F16 Lightning Indexer,支持 128 维、64 头输入,F32 查询和权重,F16 键和掩码。新增 tiled 和 tail 内核,测试了 KV 长度在 8 和 64 元素边界附近的情况。llama-bench 基准测试显示,在 KV 缓存大小为 10k、20k、30k 时,预填充速度分别从 73.90、45.83、33.40 t/s 提升到 86.95、62.01、49.18 t/s。

EVENT STORY

发展脉络

  1. 首次出现b10236llama.cpp
  2. 当前判断llama.cpp 作为开源推理引擎,持续优化长上下文性能,可能降低长上下文应用的成本,推动更多长上下文模型在本地部署。Agent Pulse · 分析
改变了什么

llama.cpp 在 b10236 版本中实现了 Lightning Indexer,针对 128 维、64 头输入,支持 F32 查询和权重、F16 键和掩码。该实现包括 tiled 和 tail 内核,并测试了 KV 长度在 8 和 64 元素边界附近的情况。基准测试显示,在 KV 缓存大小为 10k、20k、30k 时,预填充速度分别从 73.90、45.83、33.40 t/s 提升到 86.95、62.01、49.18 t/s,提升幅度分别为 17.7%、35.3%、47.2%。此外,还实现了 Lightning Indexer K 块的 stage 和 dequantize,支持多种量化格式。

能力边界怎么变了

Lightning Indexer 的实现可能通过优化 KV 缓存访问模式,减少了长上下文下的预填充延迟。预填充速度在 KV 缓存增大时提升更明显,表明该优化对长上下文场景更有效。下一步可观察该优化是否被推广到其他模型架构,以及是否影响生成速度。

为什么重要

llama.cpp 作为开源推理引擎,持续优化长上下文性能,可能降低长上下文应用的成本,推动更多长上下文模型在本地部署。

对谁有影响

该优化可能降低长上下文推理的延迟和成本,对提供长上下文服务的公司有直接价值。

接下来观察

未来可关注 Lightning Indexer 是否被合并到主分支,以及是否支持更多模型和硬件。