b10731: qwen4exp: support recurrent state rollback (#28123)
llama.cpp 发布 b10731,为 Qwen4Exp 增加 recurrent state rollback 支持。MTP 投机解码需要目标状态回退被拒绝的 draft token 数量。此前无回滚时,上下文被分类为 SEQ_RM_TYPE_FULL,服务器每轮将整个 recurrent state 序列化到主机内存,成本高于 draft 节省。recurrent cache 已有 n_rs_seq + 1 个快照平面,但 build_conv_state_at 只写一个平面,导致回滚恢复从未捕获的卷积历史。现在为 delta net QKV 卷积和 PLE 卷积每个槽位写一个快照,每个快照提前一个 token 结束。在 Qwen3.8-Flash-Next UD-Q4_K_XL 上,使用独立 MTP draft、n-max 3 和单槽位,解码速度达到代码 183 tok/s、散文 144 tok/s;此前回退到主机内存检查点的分支为 123 和 83 tok/s,无 draft 时为 108 tok/s。
Development
- First Reportb10731: qwen4exp: support recurrent state rollback (#28123)llama.cpp
- Industry Responseqwen4exp fixes in llama.cppReddit r/LocalLLaMA
- Industry Responseqwen4exp: add hc ops by am17an · Pull Request #28901 · ggml-org/llama.cppReddit r/LocalLLaMA
- Industry ResponseQwen 4 Announced at Apsara ConferenceReddit r/LocalLLaMA
- Industry Response阿里 Qwen4 和下代视频模型训练中,Qwen4.5 后模型将扩展至 5-10T 参数IT之家 AI
- Industry Response阿里公布全模态模型新进展,Qwen4和下代视频模型均在训练中量子位
- Current Assessmentllama.cpp 作为开源推理引擎,持续优化新架构(如 Qwen4Exp)的推理性能,表明开源社区对前沿模型的支持速度加快。此类优化有助于降低 recurrent 模型的推理成本,推动其在生产环境中的应用。Agent Pulse · analysis
llama.cpp 的 b10731 版本为 Qwen4Exp 模型添加了 recurrent state rollback 支持,解决了 MTP 投机解码中因状态回退缺失导致的性能问题。此前,当 MTP draft 被拒绝时,目标状态需要回退相应数量的 token,但缺乏回滚支持导致上下文被标记为 SEQ_RM_TYPE_FULL,服务器被迫每轮将整个 recurrent state 序列化到主机内存,开销超过了投机解码的收益。修复通过为 delta net 的 QKV 卷积和 PLE 卷积分别写入多个快照平面,每个快照对应一个更早的 token 位置,使得回滚能够正确恢复卷积历史。实测在 Qwen3.8-Flash-Next UD-Q4_K_XL 模型上,使用独立 MTP draft 和 n-max 3 时,解码速度从 123/83 tok/s(代码/散文)提升到 183/144 tok/s,相比无 draft 的 108 tok/s 有显著提升。
该修复揭示了投机解码中状态回滚的复杂性:recurrent 模型(如 SSM)的缓存需要保存多个时间步的快照,而不仅仅是单一状态。llama.cpp 通过为每个槽位写入独立的卷积快照,实现了精确的回滚,避免了全量序列化。这提示在实现投机解码时,需要为 recurrent 状态设计多版本缓存机制,以平衡内存开销和回滚精度。
llama.cpp 作为开源推理引擎,持续优化新架构(如 Qwen4Exp)的推理性能,表明开源社区对前沿模型的支持速度加快。此类优化有助于降低 recurrent 模型的推理成本,推动其在生产环境中的应用。
该优化直接提升了 recurrent 模型的解码速度,降低了推理成本,对部署此类模型的服务商有直接价值。更快的解码意味着更低的延迟和更高的吞吐量,可改善用户体验并降低单位请求成本。
未来,recurrent 模型(如 SSM)的推理优化将更注重投机解码与状态管理的结合。可验证的下一信号是:llama.cpp 或其他推理框架是否会为更多 recurrent 模型提供类似的多快照回滚支持,以及是否会出现更高效的状态压缩技术。