AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Aug 7, 2026 · llama.cpp

b10322

What Happened

llama.cpp 发布 b10322 版本,通过 SYCL 后端合并 SSM_CONV 窗口加载,在 Arc Pro B70 上 SSM_CONV 性能提升约 1.85-1.87 倍,Qwen3.5 27B Q4_K 模型在特定配置下预填充性能提升约 2.2%。

EVENT STORY

Development

  1. First Reportb10322llama.cpp
  2. Current Assessmentllama.cpp 持续优化 SYCL 后端,表明 Intel GPU 在 AI 推理中的重要性提升,开源社区对多后端支持的需求增长。Agent Pulse · analysis
What Changed

llama.cpp 发布 b10322 版本,通过 SYCL 后端合并 SSM_CONV 窗口加载,在 Arc Pro B70 上 SSM_CONV 性能提升约 1.85-1.87 倍,Qwen3.5 27B Q4_K 模型在特定配置下预填充性能提升约 2.2%。

How the Capability Boundary Shifted

该优化针对 SYCL 后端的 SSM_CONV 算子,通过合并窗口加载减少内存访问开销,在特定形状下实现近两倍加速,但 token 生成阶段无明显变化,表明优化主要影响预填充阶段。

Why It Matters

llama.cpp 持续优化 SYCL 后端,表明 Intel GPU 在 AI 推理中的重要性提升,开源社区对多后端支持的需求增长。

Who It Affects

对于使用 Intel GPU 的推理服务,该优化可降低预填充延迟,提升吞吐量,减少成本。

What to Watch Next

未来可能看到更多针对 SSM 架构的优化,以及 SYCL 后端在更多模型上的性能提升。