AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年7月30日 · llama.cpp

b10188

发生了什么

llama.cpp 发布 b10188 版本,修复了 Metal 后端在模型释放时未执行 GPU 操作导致的内存泄漏和内存未解除映射问题,并增加了系统级有线内存测量。

EVENT STORY

发展脉络

  1. 首次出现b10188llama.cpp
  2. 当前判断llama.cpp 作为广泛使用的开源推理引擎,其内存泄漏修复表明跨平台推理框架在内存管理上仍需持续优化,尤其是针对不同 GPU 后端(如 Metal)的特定问题。Agent Pulse · 分析
改变了什么

llama.cpp 发布 b10188 版本,主要修复了 Metal 后端的内存泄漏和内存未解除映射问题,当模型被释放但未执行任何 GPU 操作时,之前的内存未正确清理。此外,该版本还增加了系统级有线内存测量功能,并改进了回归测试。该版本支持 macOS Apple Silicon、iOS、Linux、Windows、Android 等多个平台。

能力边界怎么变了

该修复针对 Metal 后端的内存管理,确保在模型释放时即使没有 GPU 操作也能正确解除内存映射,避免内存泄漏。这暗示了 Metal 后端之前存在资源生命周期管理缺陷,可能影响长时间运行的推理服务。

为什么重要

llama.cpp 作为广泛使用的开源推理引擎,其内存泄漏修复表明跨平台推理框架在内存管理上仍需持续优化,尤其是针对不同 GPU 后端(如 Metal)的特定问题。

对谁有影响

对于依赖 llama.cpp 进行本地推理的应用,该修复降低了内存泄漏导致的服务不稳定风险,提升了长期运行的可靠性。

接下来观察

预计后续版本会进一步优化 Metal 后端的性能,并可能引入更细粒度的内存监控工具。