AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年7月26日 · ONNX Runtime

ONNX Runtime v1.28.0

发生了什么

ONNX Runtime v1.28.0 发布,升级到 ONNX 1.22.0 和 protobuf 6.33.5,CUDA EP 运行时不再强制依赖 cuDNN/cuFFT,移除 nvrtc 链接,引入实验性 C/C++ API,弃用 SkipLayerNorm strict mode,移除 TensorRT fused causal attention kernels,默认关闭 CUDA_QUANT_PREPROCESS,NPM 包从 CUDA 13 流水线发布。

EVENT STORY

发展脉络

  1. 首次出现ONNX Runtime v1.28.0ONNX Runtime Releases
  2. 当前判断ONNX Runtime 作为跨平台推理引擎,其减少 CUDA 依赖的举措可能推动边缘部署和容器化场景的普及,降低推理基础设施成本。同时,移除 TensorRT 融合内核可能影响 NVIDIA 生态的集成深度,但可能为其他后端腾出空间。NPM 包从 CUDA 13 流水线发布,表明对最新 CUDA 的支持,可能吸引使用新硬件的开发者。Agent Pulse · 分析
改变了什么

ONNX Runtime v1.28.0 发布,主要变更包括:升级 ONNX 到 1.22.0 和 protobuf 6.33.5;CUDA EP 运行时不再强制依赖 cuDNN/cuFFT,并移除 nvrtc 链接,显著减少 CUDA 发行版占用;引入实验性 C/C++ API(OrtModelPackageApi);弃用 SkipLayerNorm strict mode;移除 TensorRT fused causal attention kernels;默认关闭 CUDA_QUANT_PREPROCESS;NPM 包从 CUDA 13 流水线发布。这些变化影响部署、兼容性和开发者体验。

能力边界怎么变了

CUDA EP 运行时可选 cuDNN/cuFFT 并移除 nvrtc 链接,意味着推理部署不再需要完整 CUDA 工具包,可能降低容器镜像大小和启动复杂度。但需注意,某些算子可能仍需要这些库,开发者需验证功能完整性。实验性 C/C++ API 引入 OrtModelPackageApi,暗示未来可能提供更稳定的模型打包接口,但当前可能变化。移除 TensorRT fused causal attention kernels 可能影响特定模型在 TensorRT 上的性能,需关注替代方案。

为什么重要

ONNX Runtime 作为跨平台推理引擎,其减少 CUDA 依赖的举措可能推动边缘部署和容器化场景的普及,降低推理基础设施成本。同时,移除 TensorRT 融合内核可能影响 NVIDIA 生态的集成深度,但可能为其他后端腾出空间。NPM 包从 CUDA 13 流水线发布,表明对最新 CUDA 的支持,可能吸引使用新硬件的开发者。

对谁有影响

对于使用 ONNX Runtime 进行推理部署的企业,此版本可降低 CUDA 依赖带来的运维成本,简化容器镜像和部署流程。但需评估移除 TensorRT 内核和默认关闭量化预处理对现有模型性能的影响,可能需要进行回归测试。对于依赖 TensorRT 加速的场景,需关注替代方案或等待后续优化。

接下来观察

后续可关注:1) 实验性 C/C++ API 的稳定性,是否在后续版本中正式化;2) CUDA EP 在缺少 cuDNN/cuFFT 时的性能表现,是否有回归;3) TensorRT 融合内核移除后,是否有替代优化;4) CUDA 13 流水线是否成为默认,影响旧版本兼容性。