b10238
llama.cpp 发布 b10238 版本,为 Qwen3-Next 模型添加 MTP(Multi-Token Prediction)支持,包含 Python 类型检查修复、从 MTP 层直接计算 num_mtp、在 _QwenMtpMixin 中定义 opt_num_mtp_layers 等改动,并更新了 gguf-py 常量及加载标志。
Development
- First Reportb10238llama.cpp
- Current Assessmentllama.cpp 作为广泛使用的本地推理引擎,对 Qwen3-Next 的 MTP 支持表明多 token 预测正在成为主流模型特性。这反映了行业对推理效率的持续追求,通过减少解码步骤来降低延迟。开源社区对 MTP 的快速适配,也说明该技术已从研究走向实用。Agent Pulse · analysis
llama.cpp 在 2026 年 8 月 3 日发布 b10238 版本,核心是为 Qwen3-Next 模型引入 MTP(多 token 预测)支持。该版本包含多项代码修复,包括 Python 类型检查、从 MTP 层直接计算 num_mtp 参数、在 _QwenMtpMixin 中定义 opt_num_mtp_layers,以及更新 gguf-py 常量和加载标志。这些改动使 llama.cpp 能够更好地支持 Qwen3-Next 的 MTP 特性,可能提升推理效率。
MTP 支持意味着 llama.cpp 能够利用 Qwen3-Next 的多 token 预测能力,这通常通过并行预测多个未来 token 来加速推理。从代码改动看,num_mtp 参数现在直接从 MTP 层计算,表明模型架构中 MTP 层是独立定义的,且加载时需显式设置 load_mtp 标志。这暗示 MTP 可能作为可选特性,需要用户或开发者手动启用。
llama.cpp 作为广泛使用的本地推理引擎,对 Qwen3-Next 的 MTP 支持表明多 token 预测正在成为主流模型特性。这反映了行业对推理效率的持续追求,通过减少解码步骤来降低延迟。开源社区对 MTP 的快速适配,也说明该技术已从研究走向实用。
对于依赖本地推理的开发者,MTP 支持可能降低推理成本,提升响应速度,从而改善用户体验。这有助于 llama.cpp 生态吸引更多用户,并可能推动相关硬件和工具链的优化。
后续可关注 Qwen3-Next 的 MTP 在 llama.cpp 中的实际性能表现,以及是否有更多模型采用类似架构。同时,MTP 的推理加速效果可能成为模型评估的新维度,影响未来模型设计。