AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Jul 27, 2026 · llama.cpp

b10152

What Happened

llama.cpp 发布 b10152 版本,新增功能:根据 n_gpu_layers 计算 nextn (MTP) 块的数量,使前层保留在 GPU 上。该版本提供多种平台构建,包括 macOS、iOS、Linux、Android、Windows 和 openEuler,并支持多种后端如 Vulkan、CUDA、ROCm 等。

EVENT STORY

Development

  1. First Reportb10152llama.cpp
  2. Current Assessmentllama.cpp 作为开源推理引擎,持续优化 MTP 等高级特性,反映了开源社区在推理性能优化上的活跃。此举可能推动更多应用采用 MTP 技术,并影响其他推理框架的优化方向。Agent Pulse · analysis
What Changed

llama.cpp 发布 b10152 版本,引入一项新功能:根据 n_gpu_layers 计算 nextn (MTP) 块的数量,以确保前层保留在 GPU 上。该版本同时提供了广泛的平台支持,包括 macOS(Apple Silicon 和 Intel)、iOS、Linux(多种 CPU 架构和 GPU 后端)、Android、Windows(多种后端)以及 openEuler。这一更新旨在优化多 token 预测(MTP)场景下的 GPU 内存分配,提升推理性能。

How the Capability Boundary Shifted

该功能通过动态计算 MTP 块的数量,使其与 n_gpu_layers 配置匹配,从而在 GPU 内存有限时优先保留前层,可能减少 CPU-GPU 间数据传输,提升推理效率。这暗示 llama.cpp 正在优化 MTP 的显存管理,未来可能进一步支持更灵活的层分配策略。

Why It Matters

llama.cpp 作为开源推理引擎,持续优化 MTP 等高级特性,反映了开源社区在推理性能优化上的活跃。此举可能推动更多应用采用 MTP 技术,并影响其他推理框架的优化方向。

Who It Affects

对于依赖 llama.cpp 的开发者,该更新可能降低 MTP 推理的显存需求,减少硬件成本,提升部署灵活性。

What to Watch Next

后续可关注 llama.cpp 是否将 MTP 优化扩展到更多后端,以及是否引入自动调整 n_gpu_layers 的功能。