AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Aug 4, 2026 · llama.cpp

b10247

What Happened

llama.cpp 发布 b10247 版本,将后端调度器中固定大小的 GGML_SCHED_MAX_SPLIT_INPUTS 数组替换为动态分配缓冲区,以修复在加载宽 MoE 模型(如 Gemma 4、Qwen MoE、Mixtral、DeepSeek)时,多后端设置下图拆分超过 30 个输入张量导致的崩溃。

EVENT STORY

Development

  1. First Reportb10247llama.cpp
  2. Current Assessment此修复反映了开源推理框架对宽 MoE 模型支持的持续投入,可能影响多后端部署的稳定性,推动更多用户在生产环境采用 MoE 模型。Agent Pulse · analysis
What Changed

llama.cpp 在 b10247 版本中修复了多后端调度器的一个关键问题:将固定大小的 GGML_SCHED_MAX_SPLIT_INPUTS 数组改为动态分配,支持按需增长。此前,当加载宽 MoE 模型(如 Gemma 4、Qwen MoE、Mixtral、DeepSeek)时,图拆分可能超过 30 个输入张量,导致崩溃。该修复通过动态分配 split->inputs 和 sched->graph_inputs 数组,并基于实际输入数量计算图大小,解决了这一限制。

How the Capability Boundary Shifted

该修复表明 llama.cpp 的调度器正在从静态上限转向动态资源管理,以适应 MoE 模型日益增长的宽度。可验证的下一信号是:后续版本是否进一步优化动态分配的性能,或引入更灵活的图调度策略。

Why It Matters

此修复反映了开源推理框架对宽 MoE 模型支持的持续投入,可能影响多后端部署的稳定性,推动更多用户在生产环境采用 MoE 模型。

Who It Affects

该修复提升了 llama.cpp 在复杂模型推理场景下的可靠性,降低了因崩溃导致的运维成本,对依赖多后端推理的企业具有直接价值。

What to Watch Next

预计 llama.cpp 将继续优化对大规模 MoE 模型的支持,可能包括更高效的内存管理和调度算法,以降低推理成本。