AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年8月2日 · llama.cpp

b10224

发生了什么

llama.cpp 发布 b10224 版本,新增 ggml-webgpu 对 f16 repeat 的支持(PR #26307)。该版本提供 macOS、iOS、Linux、Android、Windows 及 openEuler 等多平台构建,其中部分平台(如 macOS Intel、openEuler)标记为 DISABLED。

EVENT STORY

发展脉络

  1. 首次出现b10224llama.cpp
  2. 当前判断llama.cpp 持续扩展多平台支持,包括 WebGPU 和多种硬件后端,反映开源推理框架对多样化和边缘部署的重视。但禁用部分平台可能表明维护资源有限或平台优先级调整。Agent Pulse · 分析
改变了什么

llama.cpp 发布 b10224 版本,主要新增 ggml-webgpu 对 f16 repeat 的支持(PR #26307)。版本构建覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 等平台,包含 CPU、Vulkan、ROCm、OpenVINO、SYCL、CUDA、OpenCL 等多种后端。部分平台构建被禁用,如 macOS Intel 和 openEuler。

能力边界怎么变了

ggml-webgpu 支持 f16 repeat 意味着 WebGPU 后端在特定操作上支持半精度浮点,可能提升推理效率。但证据未提供性能数据或具体影响,需进一步验证。

为什么重要

llama.cpp 持续扩展多平台支持,包括 WebGPU 和多种硬件后端,反映开源推理框架对多样化和边缘部署的重视。但禁用部分平台可能表明维护资源有限或平台优先级调整。

对谁有影响

对开发者而言,WebGPU 支持可能降低 Web 端推理门槛,但需评估实际性能收益。对依赖特定平台的企业,禁用平台可能影响部署计划。

接下来观察

后续可关注 WebGPU 后端对更多操作的支持及性能基准测试,以及禁用平台是否恢复。