b10165
llama.cpp 发布 b10165 版本,在 Vulkan 后端重新支持 iq4_nl 量化,并新增 q1_0 对非 coopmat2 硬件的支持。
发展脉络
- 首次出现b10165llama.cpp
- 当前判断llama.cpp 作为开源推理引擎,持续优化量化支持,表明社区对低比特量化的需求旺盛,尤其是在消费级硬件上运行大模型。Vulkan 后端的改进有助于跨平台部署,特别是移动和嵌入式设备。Agent Pulse · 分析
llama.cpp 于 2026 年 7 月 28 日发布 b10165 版本,主要更新包括:在 Vulkan 后端重新添加 iq4_nl 量化支持,并新增 q1_0 量化对非 coopmat2 硬件的支持。该版本修复了 issue #23681,移除了 q1_0 的 FA 支持。发布页面提供了适用于 macOS、Linux、Windows、Android 等多种平台的预编译包。
iq4_nl 是一种 4 位量化格式,之前因共享内存占用问题被移除,此次重新加入表明开发者认为其性能收益大于共享内存开销。q1_0 是极低比特量化,仅支持非 coopmat2 硬件,说明该格式对硬件特性有依赖。这些更新反映了 llama.cpp 在量化推理方面持续优化,平衡精度、速度和硬件兼容性。
llama.cpp 作为开源推理引擎,持续优化量化支持,表明社区对低比特量化的需求旺盛,尤其是在消费级硬件上运行大模型。Vulkan 后端的改进有助于跨平台部署,特别是移动和嵌入式设备。
llama.cpp 的持续更新降低了在本地设备上运行大模型的成本,有利于边缘计算和隐私敏感场景。量化支持增强了模型在低端硬件上的可用性,可能吸引更多开发者基于 llama.cpp 构建应用,从而扩大开源生态的商业价值。
未来可关注 llama.cpp 是否进一步扩展量化格式(如 iq4_nl 在其他后端的支持),以及 q1_0 在更多硬件上的适配。此外,Vulkan 后端的性能优化可能推动更多移动端应用。