b10229
llama.cpp 发布 b10229 版本,修复了 ggml_backend_opencl_init() 中 ref_count 未递增的问题,该问题可能导致 OpenCL 后端在程序结束时 profiling 数据未刷新。
Development
- First Reportb10229llama.cpp
- Current Assessmentllama.cpp 持续维护多后端支持,包括 OpenCL、Vulkan、CUDA 等,此次修复体现了对边缘平台(如 Adreno GPU)的稳定性关注,可能影响依赖 OpenCL 后端的嵌入式或移动端推理场景。Agent Pulse · analysis
llama.cpp 于 2026-08-02 发布 b10229 版本,修复了 OpenCL 后端的一个 bug:在 ggml_backend_opencl_init() 中递增 ref_count,确保在程序结束时 profiling 数据能够正确刷新和写入。该修复影响使用 OpenCL 后端的用户,尤其是 Windows arm64 (OpenCL Adreno) 等平台。
该修复表明 ref_count 管理在 ggml_backend_opencl_context 的生命周期中至关重要,递增 ref_count 可避免 free() 时引用计数为 -1,从而保证 profiling 数据正常输出。这提示开发者在使用类似资源管理时需注意引用计数的正确性。
llama.cpp 持续维护多后端支持,包括 OpenCL、Vulkan、CUDA 等,此次修复体现了对边缘平台(如 Adreno GPU)的稳定性关注,可能影响依赖 OpenCL 后端的嵌入式或移动端推理场景。
对于使用 OpenCL 后端的用户,此修复可避免 profiling 数据丢失,有助于性能分析和优化,从而降低开发调试成本。
未来可能看到更多针对 OpenCL 后端的优化或修复,尤其是在 profiling 和资源管理方面,以提升在非主流硬件上的推理稳定性。