AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年7月25日 · Ollama

v0.32.4-rc0: model: add Laguna MLX support (#17237)

发生了什么

Ollama 发布 v0.32.4-rc0,为 MLX 模型新增 Laguna 支持,涵盖 XS 2、XS 2.1 和 S 2.1 变体。该版本读取源配置以在密集和路由 MoE 层应用统一量化策略,保持 tied output head 和 router 为源精度,量化受支持的 attention 和 expert projections,并选择性提升敏感的 expert down projections。它修正了密集 expert 加载、BF16 源布局处理、expert global-scale 形状和数据类型、路由分数缩放以及混合精度 expert 分发。Gate/up 和 down projections 独立选择量化或密集执行。优化包括兼容的 gate/up 融合、排序的标准 GatherMM 和 GatherQMM 操作、模型本地 mlx.Compile 闭包以及缓存支持的 512-token prefill 块。添加了针对 Laguna 配置变体、量化策略和元数据、密集和路由 expert 加载的测试。

EVENT STORY

发展脉络

  1. 首次出现v0.32.4-rc0: model: add Laguna MLX support (#17237)Ollama
  2. 当前判断Ollama 对 Laguna 模型的支持表明其持续扩展对新兴模型架构的覆盖,尤其是在 Apple Silicon 生态中。通过 MLX 实现混合精度量化,可能降低 MoE 模型在本地硬件上的部署门槛,推动边缘推理的实用化。Agent Pulse · 分析
改变了什么

Ollama 发布 v0.32.4-rc0,为 MLX 模型新增 Laguna 支持,涵盖 XS 2、XS 2.1 和 S 2.1 变体。该版本读取源配置以在密集和路由 MoE 层应用统一量化策略,保持 tied output head 和 router 为源精度,量化受支持的 attention 和 expert projections,并选择性提升敏感的 expert down projections。它修正了密集 expert 加载、BF16 源布局处理、expert global-scale 形状和数据类型、路由分数缩放以及混合精度 expert 分发。Gate/up 和 down projections 独立选择量化或密集执行。优化包括兼容的 gate/up 融合、排序的标准 GatherMM 和 GatherQMM 操作、模型本地 mlx.Compile 闭包以及缓存支持的 512-token prefill 块。添加了针对 Laguna 配置变体、量化策略和元数据、密集和路由 expert 加载的测试。

能力边界怎么变了

该版本展示了在 MLX 上对 MoE 模型进行混合精度量化的细致方法,通过选择性提升敏感投影来平衡压缩与质量。优化策略(如 gate/up 融合和排序的 GatherMM)表明在保持数值稳定性的同时,针对更大 prefill 的推理性能调优。使用模型本地 mlx.Compile 闭包和缓存 prefill 块,反映了对 MLX 运行时特性的深入利用,以提升效率。

为什么重要

Ollama 对 Laguna 模型的支持表明其持续扩展对新兴模型架构的覆盖,尤其是在 Apple Silicon 生态中。通过 MLX 实现混合精度量化,可能降低 MoE 模型在本地硬件上的部署门槛,推动边缘推理的实用化。

对谁有影响

对于依赖本地推理的开发者,该版本提供了更高效的 MoE 模型运行方式,可能降低推理成本并提升响应速度。Ollama 通过持续支持新模型,巩固其作为本地模型运行工具的地位,吸引更多用户和生态贡献。

接下来观察

后续可关注该版本正式发布后的稳定性反馈,以及是否扩展支持更多 Laguna 变体或类似 MoE 架构。MLX 上的优化模式可能被其他推理框架借鉴,推动混合精度量化的标准化。