gfx950-tutorial-v2.2
Triton 发布 gfx950-tutorial-v2.2,基于上游 triton main 01c5d2a(含 [AMD][gfx950][Gluon] Add cd_regclass to mfma and mfma_scaled, #11792)以及两个仍在评审中的上游 PR。该版本不再携带任何 fork-only 特性:v2.1 中的 TRITON_FORCE_MFMA_AGPR 与 gl.warp_predicate 被移除,教程内核改为按 MFMA 传 cd_regclass="a",fmha_v4 使用 gl.map_elementwise。LLVM 侧上游将 AMDGCN 构建为独立的 libtriton_amd_codegen.so;核心 LLVM 固定为 b010a18d,AMD codegen LLVM 为 ce3529423(含 computePSetLimit 修复 llvm#216372)。版本在 #11916 之前固定,因为该快照会使 gfx950 寄存器压力回退。
发展脉络
- 首次出现gfx950-tutorial-v2.2Triton Compiler Releases
- 当前判断AMD gfx950 相关的 Triton 教程栈持续以版本化方式发布,且明确以「不再携带 fork-only 特性」为目标,反映开放编译器生态中硬件厂商调优正逐步回流上游。这属于工具链层面的渐进整合,证据未提供采用率、性能数字或商业条款,因此不宜外推为市场格局变化。Agent Pulse · 分析
Triton 发布 gfx950-tutorial-v2.2,把此前 fork 专属的改动全部收敛回上游:基于 triton main 01c5d2a(含 #11792 为 mfma 与 mfma_scaled 增加 cd_regclass)加两个在评审中的上游 PR。v2.1 的 TRITON_FORCE_MFMA_AGPR 与 gl.warp_predicate 被删除,教程内核改为逐 MFMA 传 cd_regclass="a",fmha_v4 改用 gl.map_elementwise。LLVM 侧 AMDGCN 现在构建为独立的 libtriton_amd_codegen.so;核心 LLVM 保持 b010a18d 以维持 LLIR-scheduler 插件 ABI,AMD codegen LLVM 为 ce3529423(含 computePSetLimit 修复)。版本刻意固定在 #11916 之前,因为该快照会回退 gfx950 寄存器压力。
从证据看,这次发布的核心变化是减少 fork 分叉:环境变量开关(LLVM_PASS_PLUGIN_KEEP_TARGET_MACHINE、TRITON_FORCE_MFMA_AGPR)被上游机制替代,说明 AMD 后端正在把 gfx950 调优参数从外部开关转为内核级/编译级显式配置。可验证的下一信号是 #11916 中 d26ff26e 快照的寄存器压力回退是否修复,以及两个在评审 PR 是否合入 main。
AMD gfx950 相关的 Triton 教程栈持续以版本化方式发布,且明确以「不再携带 fork-only 特性」为目标,反映开放编译器生态中硬件厂商调优正逐步回流上游。这属于工具链层面的渐进整合,证据未提供采用率、性能数字或商业条款,因此不宜外推为市场格局变化。
对依赖 Triton 编译 AMD gfx950 内核的团队,此版本降低了维护 fork 的成本:调优通过 cd_regclass 等上游接口表达,而非私有环境变量。但版本被固定在 #11916 之前,意味着升级路径存在已知回退风险,需在采用前验证寄存器压力与调度行为。
若 #11916 的寄存器压力回退被修复并重新固定,gfx950 教程栈可继续跟随上游 main;若两个在评审 PR 未合入,该版本将停留在 01c5d2a 基线。观察点是下一次 release tag 的基线 commit 与是否重新引入 fork-only 开关。