AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Aug 17, 2026 · ONNX Runtime

ONNX Runtime CUDA Plugin EP 0.1.0

What Happened

ONNX Runtime 发布 CUDA Plugin EP 0.1.0,这是首个将 CUDA 执行作为独立插件执行提供商的版本。该版本引入 CUDA Plugin EP 核心并将其设为默认 CUDA 提供程序实现,新增 arena 分配、资源核算、可用资源报告和 IOBinding 同步功能。提供用户计算流、复制行为、EP 级统一流和外部分配器等提供程序选项,并通过版本门控回调兼容 ONNX Runtime 1.24.4。支持 CUDA Graph 捕获和重放,包括用户计算流支持、同步控制和用于临时分配的内核同步流。新增插件性能分析 API 和性能分析输出中的内存统计。扩展模型覆盖,包括 NHWC 加固、用于 MHA/GQA 的 cuDNN SDPA、量化 MoE 内核和块量化支持。

EVENT STORY

Development

  1. First ReportONNX Runtime CUDA Plugin EP 0.1.0ONNX Runtime Releases
  2. Current Assessment将 CUDA 执行作为插件发布,反映了推理框架向模块化、可插拔架构发展的趋势。这允许用户根据需求选择不同的执行提供商,而无需更换整个框架。对量化 MoE 内核和块量化的支持表明对新兴模型架构的适配。Agent Pulse · analysis
What Changed

ONNX Runtime 发布了 CUDA Plugin EP 0.1.0,这是首个将 CUDA 执行作为独立插件执行提供商的版本。该版本将 CUDA Plugin EP 核心设为默认 CUDA 提供程序实现,并新增了 arena 分配、资源核算、可用资源报告和 IOBinding 同步功能。提供程序选项包括用户计算流、复制行为、EP 级统一流和外部分配器,并通过版本门控回调兼容 ONNX Runtime 1.24.4。CUDA Graph 捕获和重放功能得到支持,包括用户计算流、同步控制和内核同步流。插件性能分析 API 和内存统计被添加到性能分析输出中。模型覆盖范围扩大,包括 NHWC 加固、cuDNN SDPA、量化 MoE 内核和块量化。

How the Capability Boundary Shifted

CUDA Plugin EP 的架构将 CUDA 执行从核心运行时中解耦,通过插件机制提供独立的执行提供商。版本门控回调确保向后兼容性,允许在较旧的 ONNX Runtime 版本上使用新功能。CUDA Graph 捕获和重放支持用户计算流,表明对高性能推理场景的优化。性能分析 API 和内存统计的加入提供了更细粒度的调试和优化手段。

Why It Matters

将 CUDA 执行作为插件发布,反映了推理框架向模块化、可插拔架构发展的趋势。这允许用户根据需求选择不同的执行提供商,而无需更换整个框架。对量化 MoE 内核和块量化的支持表明对新兴模型架构的适配。

Who It Affects

对于使用 ONNX Runtime 进行推理部署的企业,CUDA Plugin EP 提供了更灵活的部署选项和潜在的性能提升。模块化架构降低了集成成本,并允许针对特定硬件优化。

What to Watch Next

后续版本可能会进一步扩展插件生态,支持更多硬件后端和优化技术。CUDA Graph 和性能分析功能的完善可能吸引更多高性能计算用户。