v0.27.0: [Kimi][MM] disable kimi_vit's dynamic torch.compile for TPU (#51196)
vLLM v0.27.0 发布,其中包含提交 #51196,禁用了 Kimi 的 kimi_vit 在 TPU 上的动态 torch.compile。该提交由 Linkun Chen 签署,从 commit 7f58e82 精选而来。
发展脉络
- 首次出现v0.27.0: [Kimi][MM] disable kimi_vit's dynamic torch.compile for TPU (#51196)vLLM
- 当前判断vLLM 作为主流推理框架,其版本更新反映了对 TPU 等非 GPU 硬件的适配进展。禁用动态编译可能表明 TPU 上的编译优化仍需成熟,这会影响多模态模型在 TPU 上的部署效率。Agent Pulse · 分析
vLLM 项目发布了 v0.27.0 版本,该版本包含一个针对 Kimi 多模态模型的更改:禁用了 kimi_vit 在 TPU 上的动态 torch.compile。此更改由 Linkun Chen 提交,并标记为从 commit 7f58e82 精选。这一调整可能影响在 TPU 上运行 Kimi 模型的用户,尤其是那些依赖 torch.compile 动态编译功能的场景。
禁用动态 torch.compile 可能意味着在 TPU 上,动态编译带来了稳定性或性能问题,因此 vLLM 选择回退到静态编译或解释执行。这提示在 TPU 上使用 torch.compile 时,动态图可能不受支持或效率低下。对于在 TPU 上部署 Kimi 模型的开发者,需要关注此更改对推理速度和内存的影响。
vLLM 作为主流推理框架,其版本更新反映了对 TPU 等非 GPU 硬件的适配进展。禁用动态编译可能表明 TPU 上的编译优化仍需成熟,这会影响多模态模型在 TPU 上的部署效率。
对于在 TPU 上运行 Kimi 模型的企业,此更改可能影响推理性能和成本。禁用动态编译可能降低吞吐量,但可能提高稳定性。企业需评估自身场景,调整部署配置。
未来 vLLM 可能会进一步优化 TPU 上的编译策略,或提供配置选项让用户选择是否启用动态编译。关注后续版本是否恢复或改进该功能。