ONNX Runtime WebGPU Plugin EP v0.4.0
ONNX Runtime 发布 WebGPU Plugin EP v0.4.0,包含内核性能改进、算子支持扩展与可靠性修复。性能方面优化了 MatMulNBits 宽瓦片执行(subgroup shuffle)、为 Conv/MatMul 提供融合激活参数作为 uniform 并新增八个融合激活、im2col Conv 路径支持融合激活、Split 向量化、subgroup matrix MatMul 与 pointwise Conv 共享、按占用率选择 pooling 路径、预打包 Conv 权重、按 CPU 数扩展 Dawn 编译 worker。新增 PagedAttention 元数据与 GPT-OSS 支持、int8 KV cache 块量化,并实现 WebGPU subgroup-size-control 基础设施、为 WASM 构建启用 subgroup matrix 路径。
发展脉络
- 首次出现ONNX Runtime WebGPU Plugin EP v0.4.0ONNX Runtime Releases
- 当前判断WebGPU 作为浏览器与跨平台推理后端持续获得工程投入,且开始覆盖 PagedAttention、KV cache 量化等 LLM 服务化特性。判断:这有助于把部分推理负载从专用加速器与云端下沉到终端与 WASM 环境,但当前证据只体现内核与算子层面的进展,尚不足以说明成本或部署格局已改变。可验证下一信号:是否有下游框架或浏览器发行版默认启用该 EP。Agent Pulse · 分析
ONNX Runtime 的 WebGPU Plugin EP 发布 v0.4.0,重点在推理内核性能、算子覆盖与稳定性三方面。性能上优化 MatMulNBits 宽瓦片执行、把融合激活参数以 uniform 传入 Conv/MatMul 并新增八个融合激活、im2col Conv 路径支持融合激活、向量化 Split、共享 subgroup matrix MatMul 与 pointwise Conv、按占用率选择 pooling 路径、预打包 Conv 权重,并按 CPU 数扩展 Dawn 管线编译 worker。功能上新增 PagedAttention 元数据与 GPT-OSS 支持、int8 KV cache 块量化,以及 WebGPU subgroup-size-control 基础设施并为 WASM 构建启用 subgroup matrix 路径。
从变更清单看,该版本把优化重心放在矩阵乘与卷积的融合、subgroup 级并行和权重预打包上,并引入 int8 KV cache 块量化与 PagedAttention 元数据,说明 WebGPU 后端正在补齐长上下文与量化推理所需的基础设施。判断:WebGPU 上的 LLM 推理正从“能跑”转向“按占用率与内存带宽调优”。可验证下一信号:后续版本是否公布端到端 token/s 或首 token 延迟对比数据。
WebGPU 作为浏览器与跨平台推理后端持续获得工程投入,且开始覆盖 PagedAttention、KV cache 量化等 LLM 服务化特性。判断:这有助于把部分推理负载从专用加速器与云端下沉到终端与 WASM 环境,但当前证据只体现内核与算子层面的进展,尚不足以说明成本或部署格局已改变。可验证下一信号:是否有下游框架或浏览器发行版默认启用该 EP。
对依赖 ONNX Runtime 的团队,该版本可能降低 WebGPU 路径上的算子缺失与性能瓶颈风险,尤其是量化与长上下文场景。判断:价值主要体现在减少自研内核与回退 CPU 的工程量。可验证下一信号:项目是否在 release note 或文档中给出可复现的性能与兼容性数据。
若 subgroup matrix、融合激活与 int8 KV cache 等路径在后续版本稳定,WebGPU 后端可能成为端侧与 WASM 场景的可行推理选项。可验证下一信号:官方是否发布跨平台基准、算子覆盖率清单或与 CPU EP 的对比结果。