AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年7月23日 · MNN

3.6.1

发生了什么

MNN 3.6.1 版本发布,新增高通 Hexagon NPU 直接编程后端,Qwen3-0.6B 在骁龙 8 Elite 上 prefill 达 2667 tok/s,为 CPU 的 7.9 倍。Transformer C4 Fuse 全后端性能优化,覆盖 CPU/Metal/OpenCL/CUDA。新增 MNN-aware QLoRA 微调,修复多项稳定性问题。

EVENT STORY

发展脉络

  1. 首次出现3.6.1MNN Releases
  2. 当前判断MNN 3.6.1 的发布表明端侧 AI 推理正在向 NPU 直接编程演进,以突破 CPU/GPU 的性能瓶颈。高通 Hexagon NPU 的集成可能推动更多端侧模型部署,尤其是在移动设备上运行 LLM 的场景。同时,全后端优化和 QLoRA 微调支持,反映了开源推理框架在提升跨平台性能和易用性方面的竞争。Agent Pulse · 分析
改变了什么

MNN 3.6.1 版本发布,聚焦于 Hexagon NPU 后端、Transformer C4 Fuse 全后端性能优化与稳定性修复。新增高通 Hexagon NPU 直接编程后端,支持 Attention 等 LLM 关键算子,Qwen3-0.6B 在骁龙 8 Elite 上 prefill 达 2667 tok/s,为 CPU 的 7.9 倍、OpenCL GPU 的 1.8 倍。Transformer C4 图在 CPU/Metal/OpenCL/CUDA 全后端启用,包含 fused LLM 算子(RoPE、Attention、LayerNorm 等)和 packed RoPE 优化。Metal 新增 LLM prefill/decode 优化 kernel 与 Fused Q4/Q8 dequant+GEMM(M_TILE=64)。新增 MNN-aware QLoRA 微调能力,修复 mmap 分配失败崩溃、推测解码 KVCache 索引、Arm82 LinearAttention fp16 精度等问题。

能力边界怎么变了

MNN 3.6.1 通过直接编程高通 Hexagon NPU,实现了 LLM 推理的显著加速,表明 NPU 直接编程路径在端侧推理中具有巨大潜力。Transformer C4 图的全后端启用,展示了算子融合和计算图优化在跨硬件平台上的通用性。Metal 后端针对 M5 的优化(M_TILE=64)和 Fused dequant+GEMM kernel,体现了对特定硬件微架构的深度适配。MNN-aware QLoRA 微调将量化感知训练与部署后端对齐,可能提升量化模型的精度和部署效率。

为什么重要

MNN 3.6.1 的发布表明端侧 AI 推理正在向 NPU 直接编程演进,以突破 CPU/GPU 的性能瓶颈。高通 Hexagon NPU 的集成可能推动更多端侧模型部署,尤其是在移动设备上运行 LLM 的场景。同时,全后端优化和 QLoRA 微调支持,反映了开源推理框架在提升跨平台性能和易用性方面的竞争。

对谁有影响

MNN 3.6.1 通过提升端侧 LLM 推理性能,降低了端侧 AI 应用的延迟和成本,可能加速端侧 AI 产品的落地。对于依赖端侧推理的开发者,该版本提供了更高效的部署方案,可能提升产品竞争力。

接下来观察

后续可关注 MNN 对更多 NPU 架构的支持,以及 Hexagon 后端在更多模型上的性能表现。同时,MNN-aware QLoRA 微调可能成为端侧模型部署的标准流程。此外,Transformer C4 图在其他框架中的采用情况也值得关注。