AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年8月24日 · ONNX Runtime

ONNX Runtime WebGPU Plugin EP v0.3.0

发生了什么

ONNX Runtime WebGPU Plugin EP v0.3.0 发布,扩展了模型和数据类型覆盖,改进了生成模型性能,并加强了配置、可靠性和发布工具。新增了 PagedAttention、MRotaryEmbedding、GRU、DFT、PRelu、HardSwish、Trilu、Max、Min 和 MatMulBnb4 等算子支持,扩展了整数支持,包括 int64、uint8、int32/uint32。新增了 2-bit GatherBlockQuantized 支持,并集成了 ONNX 1.22 和 opset 27。生成模型方面,增加了量化 KV 缓存支持,扩展了 GQA 的滑动窗口缓存、批量右填充提示和 FlashAttention 图捕获。

EVENT STORY

发展脉络

  1. 首次出现ONNX Runtime WebGPU Plugin EP v0.3.0ONNX Runtime Releases
  2. 当前判断ONNX Runtime 作为跨平台推理引擎,其 WebGPU 后端的持续改进表明浏览器端 AI 推理正在成为行业关注点。这可能会推动更多 AI 应用在客户端运行,减少对云端的依赖,从而影响边缘计算和隐私保护。Agent Pulse · 分析
改变了什么

ONNX Runtime WebGPU Plugin EP v0.3.0 发布,扩展了模型和数据类型覆盖,改进了生成模型性能,并加强了配置、可靠性和发布工具。新增了 PagedAttention、MRotaryEmbedding、GRU、DFT、PRelu、HardSwish、Trilu、Max、Min 和 MatMulBnb4 等算子支持,扩展了整数支持,包括 int64、uint8、int32/uint32。新增了 2-bit GatherBlockQuantized 支持,并集成了 ONNX 1.22 和 opset 27。生成模型方面,增加了量化 KV 缓存支持,扩展了 GQA 的滑动窗口缓存、批量右填充提示和 FlashAttention 图捕获。

能力边界怎么变了

该版本新增了 PagedAttention 支持,表明 WebGPU 后端正在向更高效的注意力机制演进,可能为长上下文推理提供基础。量化 KV 缓存和 GQA 的滑动窗口缓存支持,暗示了在浏览器端运行生成模型时对内存和计算效率的优化。这些改进可能使 WebGPU 成为在浏览器中部署大型语言模型的更可行选项。

为什么重要

ONNX Runtime 作为跨平台推理引擎,其 WebGPU 后端的持续改进表明浏览器端 AI 推理正在成为行业关注点。这可能会推动更多 AI 应用在客户端运行,减少对云端的依赖,从而影响边缘计算和隐私保护。

对谁有影响

对于依赖浏览器端 AI 推理的产品,此版本可能降低推理成本并提升用户体验。对于云服务提供商,这可能意味着部分推理负载转移到客户端,影响其商业模式。

接下来观察

未来可关注 WebGPU 后端对更多模型架构的支持,以及其在浏览器中的性能表现。如果 PagedAttention 和量化 KV 缓存能显著提升长上下文推理效率,可能会吸引更多开发者采用 WebGPU 进行客户端推理。