AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Aug 7, 2026 · llama.cpp

b10306

What Happened

llama.cpp 发布 b10306 版本,为 SYCL 后端添加了 SWIGLU 性能测试,并整合了融合 GLU 内核,为融合 GLU 操作添加了连续快速路径。在 Arc Pro B70 上,split 模式 f16 性能提升 14%,f32 提升 4%,fused 模式无变化。

EVENT STORY

Development

  1. First Reportb10306llama.cpp
  2. Current Assessmentllama.cpp 持续优化 SYCL 后端,表明 Intel GPU 在 AI 推理中的重要性日益增加。性能提升虽小,但反映了开源社区对多平台支持的重视。Agent Pulse · analysis
What Changed

llama.cpp 在 b10306 版本中针对 SYCL 后端进行了 GLU 性能优化。具体包括:添加 SWIGLU 性能测试用例,覆盖 17408 列、512 和 2048 tokens、f16 和 f32 精度,以及融合和分离操作数;整合融合 GLU 内核,将操作作为参数传递,共享启动器,并移除冗余的块大小宏;为融合 GLU 操作添加连续快速路径,当输出与输入索引一致时,使用扁平内核。在 Arc Pro B70 上,split 模式 f16 性能提升 14%,f32 提升 4%,fused 模式无变化。

How the Capability Boundary Shifted

该优化通过减少内核启动开销和利用连续内存访问来提升性能。整合内核减少了代码重复,而连续快速路径避免了复杂的索引计算。性能提升仅在 split 模式下显著,表明 fused 模式可能已接近内存带宽瓶颈。

Why It Matters

llama.cpp 持续优化 SYCL 后端,表明 Intel GPU 在 AI 推理中的重要性日益增加。性能提升虽小,但反映了开源社区对多平台支持的重视。

Who It Affects

对于使用 Intel GPU 进行推理的用户,该优化可降低延迟和成本。对于 llama.cpp 项目,增强了其作为跨平台推理引擎的竞争力。

What to Watch Next

未来可能进一步优化 fused 模式,或针对其他 GPU 架构进行类似优化。可关注后续版本中 SYCL 后端的性能改进。