Jul 30, 2026 · llama.cpp
b10188
llama.cpp 发布 b10188 版本,修复了 Metal 后端在模型释放时未执行 GPU 操作导致的内存泄漏和内存未解除映射问题,并增加了系统级有线内存测量。
EVENT STORY
Development
- First Reportb10188llama.cpp
- Current Assessmentllama.cpp 作为广泛使用的开源推理引擎,其内存泄漏修复表明跨平台推理框架在内存管理上仍需持续优化,尤其是针对不同 GPU 后端(如 Metal)的特定问题。Agent Pulse · analysis
llama.cpp 发布 b10188 版本,主要修复了 Metal 后端的内存泄漏和内存未解除映射问题,当模型被释放但未执行任何 GPU 操作时,之前的内存未正确清理。此外,该版本还增加了系统级有线内存测量功能,并改进了回归测试。该版本支持 macOS Apple Silicon、iOS、Linux、Windows、Android 等多个平台。
该修复针对 Metal 后端的内存管理,确保在模型释放时即使没有 GPU 操作也能正确解除内存映射,避免内存泄漏。这暗示了 Metal 后端之前存在资源生命周期管理缺陷,可能影响长时间运行的推理服务。
llama.cpp 作为广泛使用的开源推理引擎,其内存泄漏修复表明跨平台推理框架在内存管理上仍需持续优化,尤其是针对不同 GPU 后端(如 Metal)的特定问题。
对于依赖 llama.cpp 进行本地推理的应用,该修复降低了内存泄漏导致的服务不稳定风险,提升了长期运行的可靠性。
预计后续版本会进一步优化 Metal 后端的性能,并可能引入更细粒度的内存监控工具。