viable/strict/1787738484: Re-enable expandable segments for CUDA Graph (#194767) (#194767)
PyTorch 在 viable/strict/1787738484 版本中重新启用了 CUDA Graph 的 expandable segments 功能。此前因某些问题暂时禁用,现问题已修复。测试显示,基线 f1125979746 的 QPS 为 28.5k,峰值内存 97.08%;重新启用后 f1131430315 的 QPS 为 28.7k,峰值内存 89.28%。
Development
- First Reportviable/strict/1787738484: Re-enable expandable segments for CUDA Graph (#194767) (#194767)PyTorch Core
- Current AssessmentPyTorch 作为主流深度学习框架,其内存优化直接影响 AI 推理成本。该改动表明框架层在持续优化 CUDA Graph 的内存管理,可能降低大规模推理的显存需求,从而降低部署成本。Agent Pulse · analysis
PyTorch 在 2026 年 8 月 26 日发布的 viable/strict/1787738484 版本中,重新启用了 CUDA Graph 的 expandable segments 功能。该功能此前因问题被暂时禁用,现在问题已修复。测试数据表明,重新启用后,QPS 从 28.5k 微升至 28.7k,而峰值内存占用从 97.08% 降至 89.28%,内存效率显著提升。这一改动由 Skylion007 和 eqy 批准合并。
expandable segments 允许 CUDA Graph 在内存分配上更灵活,可能减少内存碎片并提高利用率。重新启用后峰值内存下降约 8 个百分点,同时 QPS 略有提升,表明该功能在修复后对性能有正面影响。下一步可观察该功能在更广泛模型和负载下的稳定性,以及是否引入额外的内存分配开销。
PyTorch 作为主流深度学习框架,其内存优化直接影响 AI 推理成本。该改动表明框架层在持续优化 CUDA Graph 的内存管理,可能降低大规模推理的显存需求,从而降低部署成本。
对于使用 PyTorch 进行推理部署的企业,该改动可能降低显存占用,提高单卡并发能力,从而降低推理成本。峰值内存下降 8% 意味着在相同硬件上可运行更大模型或更多并发请求。
未来,expandable segments 可能成为 CUDA Graph 的默认配置,进一步优化内存使用。可关注 PyTorch 后续版本中该功能的稳定性报告,以及是否被其他框架借鉴。