v0.32.12: qwen3.8: add renderer and MLX import support
Ollama v0.32.12 发布,为 Qwen3.8 添加渲染器和 MLX 导入支持,包括 safetensors 导入、分片处理、量化格式识别和卷积布局归一化。Qwen 在 Hugging Face 发布 Qwen3.8-27B 和 Qwen3.8-27B-FP8 模型,任务类型为 image-text-to-text。量子位报道称模型免费下载、部署和商用。
发展脉络
- 首次出现v0.32.12: qwen3.8: add renderer and MLX import supportOllama
- 行业反馈v0.32.13: qwen3.8: support developer instructions (#17749)Ollama
- 行业反馈Qwen3.8-27B is now up to ~3× faster on Apple Silicon with mlx-dsparkReddit r/LocalLLaMA
- 行业反馈Qwen3.8 27b FIM support?Reddit r/LocalLLaMA
- 行业反馈v0.33.1-rc0: MLX: Qwen3.8 Flash Next support (#18032)Ollama
- 行业反馈llama.cpp support for Qwen3.8-Flash-Next has been mergedReddit r/LocalLLaMA
- 行业反馈Qwen3.8-Flash-Next NVFP4 Day-3 support for 4xV100Reddit r/LocalLLaMA
- 行业反馈Running 104GB Qwen3.8-Flash-Next on 48GB Mac at ~12 tok/sReddit r/LocalLLaMA
- 当前判断Qwen3.8-27B 的开源发布延续了 Qwen 系列的开源策略,强调免费商用,可能推动本地部署和社区生态。Ollama 的快速支持表明开源推理引擎对主流模型的适配速度加快,有利于模型在开发者中的采用。Agent Pulse · 分析
Ollama 发布 v0.32.12,为 Qwen3.8 模型添加渲染器和 MLX 导入支持。该版本在 safetensors 导入时检测聊天模板中的 reasoning-effort 和 preserved-thinking 语义,选择 qwen3.8 渲染器,并覆盖思考、工具、续写和畸形解析输入。同时,索引式导入使用权重映射的分片名称,拒绝不安全路径,忽略未索引张量,并在索引权重缺失或存储在不同分片时失败。量化格式被记录为 Classification.Quantize,支持自动 block-FP8 到 MXFP8 转换。Qwen 在 Hugging Face 发布 Qwen3.8-27B 和 FP8 版本,任务类型为 image-text-to-text,量子位报道称模型免费下载、部署和商用。
Ollama 的更新表明 Qwen3.8 的聊天模板引入了 reasoning-effort 和 preserved-thinking 语义,这要求推理引擎在导入时识别这些标记以选择正确的渲染器。索引式 safetensors 导入改为使用权重映射的分片名称,提高了导入的准确性和安全性。量化格式的显式记录(Classification.Quantize)为自动转换(如 block-FP8 到 MXFP8)提供了基础,可能影响推理性能。
Qwen3.8-27B 的开源发布延续了 Qwen 系列的开源策略,强调免费商用,可能推动本地部署和社区生态。Ollama 的快速支持表明开源推理引擎对主流模型的适配速度加快,有利于模型在开发者中的采用。
Qwen3.8-27B 的开源和免费商用降低了企业采用门槛,可能促进基于该模型的商业应用开发。Ollama 的集成简化了部署流程,对开发者工具链和推理基础设施提供商有积极影响。
后续可关注 Qwen3.8 系列在推理效率、多模态能力上的评测结果,以及 Ollama 等工具对 FP8 和 MXFP8 量化的支持是否带来成本下降。