AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Jul 23, 2026 · MNN

3.6.1

What Happened

MNN 3.6.1 版本发布,新增高通 Hexagon NPU 直接编程后端,Qwen3-0.6B 在骁龙 8 Elite 上 prefill 达 2667 tok/s,为 CPU 的 7.9 倍。Transformer C4 Fuse 全后端性能优化,覆盖 CPU/Metal/OpenCL/CUDA。新增 MNN-aware QLoRA 微调,修复多项稳定性问题。

EVENT STORY

Development

  1. First Report3.6.1MNN Releases
  2. Current AssessmentMNN 3.6.1 的发布表明端侧 AI 推理正在向 NPU 直接编程演进,以突破 CPU/GPU 的性能瓶颈。高通 Hexagon NPU 的集成可能推动更多端侧模型部署,尤其是在移动设备上运行 LLM 的场景。同时,全后端优化和 QLoRA 微调支持,反映了开源推理框架在提升跨平台性能和易用性方面的竞争。Agent Pulse · analysis
What Changed

MNN 3.6.1 版本发布,聚焦于 Hexagon NPU 后端、Transformer C4 Fuse 全后端性能优化与稳定性修复。新增高通 Hexagon NPU 直接编程后端,支持 Attention 等 LLM 关键算子,Qwen3-0.6B 在骁龙 8 Elite 上 prefill 达 2667 tok/s,为 CPU 的 7.9 倍、OpenCL GPU 的 1.8 倍。Transformer C4 图在 CPU/Metal/OpenCL/CUDA 全后端启用,包含 fused LLM 算子(RoPE、Attention、LayerNorm 等)和 packed RoPE 优化。Metal 新增 LLM prefill/decode 优化 kernel 与 Fused Q4/Q8 dequant+GEMM(M_TILE=64)。新增 MNN-aware QLoRA 微调能力,修复 mmap 分配失败崩溃、推测解码 KVCache 索引、Arm82 LinearAttention fp16 精度等问题。

How the Capability Boundary Shifted

MNN 3.6.1 通过直接编程高通 Hexagon NPU,实现了 LLM 推理的显著加速,表明 NPU 直接编程路径在端侧推理中具有巨大潜力。Transformer C4 图的全后端启用,展示了算子融合和计算图优化在跨硬件平台上的通用性。Metal 后端针对 M5 的优化(M_TILE=64)和 Fused dequant+GEMM kernel,体现了对特定硬件微架构的深度适配。MNN-aware QLoRA 微调将量化感知训练与部署后端对齐,可能提升量化模型的精度和部署效率。

Why It Matters

MNN 3.6.1 的发布表明端侧 AI 推理正在向 NPU 直接编程演进,以突破 CPU/GPU 的性能瓶颈。高通 Hexagon NPU 的集成可能推动更多端侧模型部署,尤其是在移动设备上运行 LLM 的场景。同时,全后端优化和 QLoRA 微调支持,反映了开源推理框架在提升跨平台性能和易用性方面的竞争。

Who It Affects

MNN 3.6.1 通过提升端侧 LLM 推理性能,降低了端侧 AI 应用的延迟和成本,可能加速端侧 AI 产品的落地。对于依赖端侧推理的开发者,该版本提供了更高效的部署方案,可能提升产品竞争力。

What to Watch Next

后续可关注 MNN 对更多 NPU 架构的支持,以及 Hexagon 后端在更多模型上的性能表现。同时,MNN-aware QLoRA 微调可能成为端侧模型部署的标准流程。此外,Transformer C4 图在其他框架中的采用情况也值得关注。