b10247
llama.cpp 发布 b10247 版本,将后端调度器中固定大小的 GGML_SCHED_MAX_SPLIT_INPUTS 数组替换为动态分配缓冲区,以修复在加载宽 MoE 模型(如 Gemma 4、Qwen MoE、Mixtral、DeepSeek)时,多后端设置下图拆分超过 30 个输入张量导致的崩溃。
发展脉络
- 首次出现b10247llama.cpp
- 当前判断此修复反映了开源推理框架对宽 MoE 模型支持的持续投入,可能影响多后端部署的稳定性,推动更多用户在生产环境采用 MoE 模型。Agent Pulse · 分析
llama.cpp 在 b10247 版本中修复了多后端调度器的一个关键问题:将固定大小的 GGML_SCHED_MAX_SPLIT_INPUTS 数组改为动态分配,支持按需增长。此前,当加载宽 MoE 模型(如 Gemma 4、Qwen MoE、Mixtral、DeepSeek)时,图拆分可能超过 30 个输入张量,导致崩溃。该修复通过动态分配 split->inputs 和 sched->graph_inputs 数组,并基于实际输入数量计算图大小,解决了这一限制。
该修复表明 llama.cpp 的调度器正在从静态上限转向动态资源管理,以适应 MoE 模型日益增长的宽度。可验证的下一信号是:后续版本是否进一步优化动态分配的性能,或引入更灵活的图调度策略。
此修复反映了开源推理框架对宽 MoE 模型支持的持续投入,可能影响多后端部署的稳定性,推动更多用户在生产环境采用 MoE 模型。
该修复提升了 llama.cpp 在复杂模型推理场景下的可靠性,降低了因崩溃导致的运维成本,对依赖多后端推理的企业具有直接价值。
预计 llama.cpp 将继续优化对大规模 MoE 模型的支持,可能包括更高效的内存管理和调度算法,以降低推理成本。