AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年7月27日 · Ollama

v0.32.5

发生了什么

Ollama 发布 v0.32.5 版本,修复了 MLX Metal 中可能降低 NVFP4 模型(特别是 Laguna)输出质量的 bug。

EVENT STORY

发展脉络

  1. 首次出现v0.32.4Ollama
  2. 行业反馈v0.32.5-rc0Ollama
  3. 行业反馈v0.32.5Ollama
  4. 当前判断Ollama 作为本地模型运行工具,其版本迭代反映了开源社区对 Apple Silicon 推理优化的持续投入,尤其是对 NVFP4 等低精度量化的支持,有助于降低本地部署门槛。Agent Pulse · 分析
改变了什么

Ollama 于 2026 年 7 月 27 日发布 v0.32.5 版本,主要修复了一个 MLX Metal 的 bug,该 bug 可能降低 NVFP4 模型(特别是 Laguna)的输出质量。此前,v0.32.4 版本(2026 年 7 月 25 日)增加了对 Apple GPU 上 Laguna 模型的支持(通过 MLX 引擎),并优化了推测解码的 draft 模型输出头量化、Qwen3 MoE 解码以及 gate/up 投影速度。v0.32.5-rc0 候选版本(2026 年 7 月 26 日)包含 MLX 更新。

能力边界怎么变了

Ollama 持续优化 MLX 引擎在 Apple GPU 上的推理支持,v0.32.4 新增 Laguna 模型支持并提升性能,v0.32.5 修复了 NVFP4 量化模型的输出质量 bug。这表明 MLX 后端在 Apple 硬件上的推理稳定性正在逐步完善。

为什么重要

Ollama 作为本地模型运行工具,其版本迭代反映了开源社区对 Apple Silicon 推理优化的持续投入,尤其是对 NVFP4 等低精度量化的支持,有助于降低本地部署门槛。

对谁有影响

Ollama 的快速迭代增强了其在 Apple 用户中的可用性,有助于吸引更多开发者使用本地模型,推动边缘推理场景的普及。

接下来观察

预计 Ollama 将继续优化 MLX 引擎,支持更多模型和量化格式,并提升 Apple GPU 上的推理效率。可关注后续版本对更多模型架构的兼容性改进。