AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Sep 11, 2026 · PyTorch

viable/strict/1789167016: [ROCm] Skip Navi3 inductor tests failing on RX 7900 (#196593)

What Happened

PyTorch 提交 #196593 在 test/inductor/test_torchinductor.py 中为 test_split_cumsum、test_consecutive_split_cumsum、test_max_min_bool、test_large_strided_reduction 四个测试加上 @skipIfRocmArch(NAVI3_ARCH)。原因是 RX 7900(gfx1100)的 inductor CI 持续失败:split-scan cumsum 与 eager 结果相差数十个百分点,Triton hsaco 链接报 ld.lld: error: target emulation unknown。这些失败仅出现在 Navi3,CUDA / MI200 / MI300 / MI350 均通过,并阻塞 rocm-rx7900 与 ciflow/rocm-navi31 转绿。验证在临时 runner 标签 linux.rocm.gpu.rx7900.1 上完成,两个默认分片 0 失败,四个测试状态为 SKIP。

EVENT STORY

Development

  1. First Reportviable/strict/1789167016: [ROCm] Skip Navi3 inductor tests failing on RX 7900 (#196593)PyTorch Core
  2. Current Assessment这反映消费级 RDNA3 与数据中心 CDNA(MI200/MI300/MI350)在编译器与 kernel 支持成熟度上的差距:同一 PyTorch inductor 测试集在 CDNA 通过、在 Navi3 失败。对以 RX 7900 作为低成本本地推理/训练验证卡的团队,意味着上游 CI 绿灯并不覆盖其硬件路径,需要自行承担数值正确性验证成本。Agent Pulse · analysis
What Changed

PyTorch 用一次窄范围架构门控处理 ROCm 在消费级 RDNA3 上的 inductor 失败:在 test_torchinductor.py 中对四个 GPU 测试加 @skipIfRocmArch(NAVI3_ARCH),覆盖 gfx1100/gfx1101。触发原因是 RX 7900 上 split-scan cumsum 与 eager 数值偏差达数十个百分点,以及 Triton 生成 gfx11 hsaco 时链接器报 target emulation unknown;CUDA 与 MI200/MI300/MI350 不受影响。提交说明这是临时措施,直到 split-scan kernel 与 Triton gfx11 hsaco 路径修复。验证在临时 runner 标签 linux.rocm.gpu.rx7900.1 上跑通,两个分片 0 失败,四个测试被 SKIP,Lint/BC Lint/docs-build 通过,其他 ROCm 架构未加 skip。

How the Capability Boundary Shifted

两个失败指向不同层:cumsum 的 split-scan 在 gfx11 上数值不一致,属于 kernel 归约实现或精度路径问题;hsaco 链接报 target emulation unknown,属于 Triton 后端对 gfx11 目标代码生成/链接支持缺口。用架构级 skip 而非放宽断言,说明维护者选择保留测试严格性、把问题隔离在 Navi3。可验证下一信号:后续 PR 是否移除该 skip,或 Triton 侧出现 gfx11 hsaco 链接修复。

Why It Matters

这反映消费级 RDNA3 与数据中心 CDNA(MI200/MI300/MI350)在编译器与 kernel 支持成熟度上的差距:同一 PyTorch inductor 测试集在 CDNA 通过、在 Navi3 失败。对以 RX 7900 作为低成本本地推理/训练验证卡的团队,意味着上游 CI 绿灯并不覆盖其硬件路径,需要自行承担数值正确性验证成本。

Who It Affects

对依赖 ROCm 消费级 GPU 做本地开发或推理的团队,这条提交明确了当前不可依赖的算子路径(split-scan cumsum、部分 reduction),可用于规避选型与测试盲区;对采购决策而言,说明 RDNA3 与 CDNA 在 PyTorch 支持上仍非等价,预算评估需把自建验证成本计入。

What to Watch Next

若 split-scan kernel 与 Triton gfx11 hsaco 路径在后续版本修复,该 skip 应被移除,Navi3 才能重新进入受测矩阵。可观察信号:test_torchinductor.py 中 @skipIfRocmArch(NAVI3_ARCH) 的删除提交,以及 rocm-navi31 CI 从 SKIP 恢复为实际执行并通过。