AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年9月2日 · PyTorch

viable/strict/1788369925: [MPS] Migrate constant pad to metal (#195368)

发生了什么

PyTorch 的 PR #195368 将 MPS Graph 的 constant pad 迁移到 Metal kernels,以解决 Wan-AI/Wan2.2-TI2V-5B-Diffusers 模型在 VAE 解码阶段因 pad 函数导致的内存爆炸问题。该 PR 将总驱动内存峰值从 270.135 GiB 降至 8.108 GiB(-97.0%),分配器外驱动内存从 262.065 GiB 降至 0.038 GiB(-99.986%),当前内存峰值从 4.422 GiB 降至 4.095 GiB。

EVENT STORY

发展脉络

  1. 首次出现viable/strict/1788369925: [MPS] Migrate constant pad to metal (#195368)PyTorch Core
  2. 当前判断该 PR 反映了 PyTorch 对 MPS 后端内存优化的持续投入,特别是针对生成式 AI 模型在 Apple Silicon 上的推理。随着视频生成模型(如 Wan)的普及,内存效率成为关键瓶颈,此类优化有助于提升 Mac 上本地推理的可行性。Agent Pulse · 分析
改变了什么

PyTorch 的 PR #195368 将 MPS Graph 的 constant pad 操作迁移到 Metal kernels,以解决 Wan-AI/Wan2.2-TI2V-5B-Diffusers 模型在 VAE 解码阶段因 pad 函数导致的内存爆炸问题。该 PR 将总驱动内存峰值从 270.135 GiB 降至 8.108 GiB(-97.0%),分配器外驱动内存从 262.065 GiB 降至 0.038 GiB(-99.986%),当前内存峰值从 4.422 GiB 降至 4.095 GiB。

能力边界怎么变了

该 PR 表明,在 MPS 后端,将 pad 操作从 MPS Graph 迁移到 Metal kernels 可以显著降低内存占用,尤其是驱动内存。这暗示 MPS Graph 的 pad 实现可能产生大量中间缓冲区或驱动开销。对于类似 Wan 模型的高频 pad 调用(如 8764 次),优化底层 kernel 实现比优化图级操作更有效。

为什么重要

该 PR 反映了 PyTorch 对 MPS 后端内存优化的持续投入,特别是针对生成式 AI 模型在 Apple Silicon 上的推理。随着视频生成模型(如 Wan)的普及,内存效率成为关键瓶颈,此类优化有助于提升 Mac 上本地推理的可行性。

对谁有影响

该优化降低了 Apple Silicon 上运行大型生成模型的硬件要求,可能使更多用户无需高端 GPU 即可本地运行视频生成模型,从而扩大 PyTorch 在创意工具和本地 AI 应用中的采用。

接下来观察

未来可能看到更多针对 MPS 后端的 kernel 级优化,以解决其他高频操作(如卷积、归一化)的内存问题。可验证的下一信号是 PyTorch 后续版本中是否包含类似优化,以及 Wan 模型在 MPS 上的内存峰值是否进一步下降。