v0.32.3-rc0: model: align Laguna with upstream llama.cpp (#17335)
Ollama 发布 v0.32.3-rc0,更新 llama.cpp 以采用上游 Laguna 实现,移除本地实现,保留针对 routed-MoE prompt overflow 的 Metal-only 缩放变通方案,并翻译旧 GGUF 元数据名称以兼容现有模型。
发展脉络
- 首次出现v0.32.3-rc0: model: align Laguna with upstream llama.cpp (#17335)Ollama
- 当前判断Ollama 作为本地模型运行工具,其更新反映了开源生态中模型实现的快速演进。对齐上游 llama.cpp 有助于保持兼容性,但也可能带来性能或行为变化,影响依赖特定版本的开发者。Agent Pulse · 分析
Ollama 在 v0.32.3-rc0 中更新了 llama.cpp,以对齐上游 Laguna 实现,并移除了本地的 Laguna 实现。同时,保留了一个针对 routed-MoE prompt overflow 的窄范围 Metal-only 缩放变通方案。此外,翻译了旧版 Ollama GGUF 的 attention-gate 和 SWA 元数据名称,确保现有模型能够继续加载。
该版本表明 Ollama 正在减少对上游实现的偏离,以降低维护成本。保留 Metal-only 变通方案暗示 routed-MoE 在 Apple 硬件上存在特定问题,可能影响 Mac 用户的推理稳定性。元数据翻译机制有助于向后兼容,但可能引入潜在的不一致。
Ollama 作为本地模型运行工具,其更新反映了开源生态中模型实现的快速演进。对齐上游 llama.cpp 有助于保持兼容性,但也可能带来性能或行为变化,影响依赖特定版本的开发者。
对于使用 Ollama 的开发者,此更新可能影响模型加载和推理行为,需验证兼容性。对于依赖 Ollama 的企业,需评估升级风险。
后续可关注 Ollama 是否完全移除 Metal 变通方案,以及上游 llama.cpp 对 routed-MoE 的进一步优化。