AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年7月28日 · llama.cpp

b10167

发生了什么

llama.cpp 发布 b10167 版本,将 llama_memory 调用抽象为 common_memory,支持多种平台和硬件后端。

EVENT STORY

发展脉络

  1. 首次出现b10167llama.cpp
  2. 当前判断llama.cpp 持续扩展硬件后端支持,包括 KleidiAI、ROCm、CUDA 等,反映了开源推理引擎对多硬件生态的重视,有助于降低 AI 推理的硬件锁定风险。Agent Pulse · 分析
改变了什么

llama.cpp 于 2026 年 7 月 28 日发布 b10167 版本,核心变更是将 llama_memory 调用抽象为 common_memory,以统一内存管理接口。该版本支持 macOS(Apple Silicon 含 KleidiAI、Intel)、Linux(CPU、Vulkan、ROCm、OpenVINO、SYCL)、Windows(CPU、CUDA、Vulkan、OpenVINO、SYCL、HIP)、Android(CPU)及 openEuler 等多种平台和硬件后端。

能力边界怎么变了

将 llama_memory 抽象为 common_memory 表明 llama.cpp 正在标准化内存管理,可能为未来支持更多异构内存架构或简化跨平台适配奠定基础。后续可关注是否引入统一内存池或 NUMA 感知优化。

为什么重要

llama.cpp 持续扩展硬件后端支持,包括 KleidiAI、ROCm、CUDA 等,反映了开源推理引擎对多硬件生态的重视,有助于降低 AI 推理的硬件锁定风险。

对谁有影响

llama.cpp 的广泛硬件支持降低了企业部署 LLM 推理的硬件成本,通过开源生态吸引开发者,可能推动更多商业应用采用本地推理方案。

接下来观察

预计 llama.cpp 将继续优化跨平台内存抽象,可能推出更细粒度的内存控制 API,并进一步扩展对新兴硬件(如 Intel GPU、AMD ROCm)的支持。