b10172
llama.cpp 发布 b10172 版本,修复了 WebGPU 绑定别名问题以支持所有架构,修复了 recurrent-state-rollback 测试,添加了 overlap glu 变体以支持所有架构,并修复了大于 4GB 缓冲区偏移的对齐问题。该版本支持 macOS Apple Silicon、iOS、Linux (CPU/Vulkan/ROCm/OpenVINO/SYCL)、Android arm64、Windows (CPU/OpenCL/CUDA) 等平台。
发展脉络
- 首次出现b10172llama.cpp
- 当前判断llama.cpp 持续优化跨平台推理支持,特别是 WebGPU 和 Vulkan 后端,表明开源社区正努力降低 AI 推理的硬件门槛。Agent Pulse · 分析
llama.cpp 发布 b10172 版本,主要修复了 WebGPU 绑定别名问题以支持所有架构,并修复了 recurrent-state-rollback 测试。新增 overlap glu 变体以支持所有架构,修复了大于 4GB 缓冲区偏移的对齐问题。该版本支持 macOS Apple Silicon、iOS、Linux (CPU/Vulkan/ROCm/OpenVINO/SYCL)、Android arm64、Windows (CPU/OpenCL/CUDA) 等平台。
该版本修复了 WebGPU 绑定别名问题,确保所有架构都能正确运行。新增 overlap glu 变体,可能提升某些模型的推理性能。修复了大于 4GB 缓冲区偏移的对齐问题,这对大模型推理至关重要。
llama.cpp 持续优化跨平台推理支持,特别是 WebGPU 和 Vulkan 后端,表明开源社区正努力降低 AI 推理的硬件门槛。
llama.cpp 的跨平台支持降低了 AI 推理的部署成本,使更多开发者能在本地运行大模型,推动边缘 AI 应用。
未来可关注 llama.cpp 对更多架构(如 Intel GPU)的支持,以及推理性能的进一步提升。