b10313
llama.cpp 发布 b10313 版本,在 server 的 router 中新增 LRU 调度器(#26572),添加 lru_sched 句柄合并(请求离开等待队列),并增加测试、修复流式场景。该版本提供 macOS、iOS、Linux、Android、Windows 及 openEuler 等多平台构建,其中部分平台(如 macOS Intel、openEuler)被禁用。
Development
- First Reportb10313llama.cpp
- Current Assessmentllama.cpp 持续迭代调度器,反映本地推理服务对并发管理的重视,可能推动边缘设备上的多用户推理场景。Agent Pulse · analysis
llama.cpp 发布 b10313 版本,主要更新集中在 server 组件的 router 部分,新增了 LRU 调度器(#26572),并添加了 lru_sched 句柄合并功能,使请求能够离开等待队列。同时增加了相关测试并修复了流式场景的问题。该版本提供了广泛的平台支持,包括 macOS(Apple Silicon)、iOS、Linux(多种架构和加速后端)、Android、Windows(多种后端)等,但部分平台如 macOS Intel 和 openEuler 被禁用。
LRU 调度器的引入可能优化了 llama.cpp server 在并发请求下的资源分配,通过句柄合并减少等待队列中的请求数量,可能提升吞吐量。但证据未提供性能数据,需观察后续基准测试。
llama.cpp 持续迭代调度器,反映本地推理服务对并发管理的重视,可能推动边缘设备上的多用户推理场景。
对于依赖 llama.cpp 提供本地推理服务的团队,此更新可能降低延迟、提升并发处理能力,但需自行验证。
后续可关注 LRU 调度器在真实负载下的性能报告,以及是否成为默认调度策略。