viable/strict/1788220221: Update third_party/kineto submodule to 9dfb9de (#195453)
PyTorch 更新了 third_party/kineto 子模块至 9dfb9de,包含 CUPTI PM Sampling API 层单元测试、使 PM Sampling 配置选项与设备无关、在 Chrome JSON 中压缩 PE 指令跟踪、CUPTI PM 采样改进、丢弃无在途请求的已完成 CUPTI 缓冲区等提交。
发展脉络
- 首次出现viable/strict/1788220221: Update third_party/kineto submodule to 9dfb9de (#195453)PyTorch Core
- 当前判断PyTorch 持续优化其性能分析工具链,表明深度学习框架在追求模型性能的同时,也重视开发者的调试和优化体验。这反映了 AI 基础设施层对可观测性和效率的持续投入。Agent Pulse · 分析
PyTorch 在 viable/strict 分支上更新了 Kineto 子模块至 9dfb9de,合并了多个 Kineto 提交,主要涉及 CUPTI 性能监控(PM)采样的改进:新增 API 层单元测试、使配置选项设备无关、改进采样逻辑、丢弃空闲缓冲区以优化内存,并压缩 PE 指令跟踪的 Chrome JSON 输出。这些改动旨在提升 GPU 性能分析工具的稳定性和效率。
Kineto 的 CUPTI PM 采样改进可能影响 GPU 性能分析的数据采集方式,设备无关的配置选项可能简化跨 GPU 架构的分析设置,而丢弃空闲缓冲区可能减少内存占用。这些改动对依赖 PyTorch Profiler 的开发者有潜在影响。
PyTorch 持续优化其性能分析工具链,表明深度学习框架在追求模型性能的同时,也重视开发者的调试和优化体验。这反映了 AI 基础设施层对可观测性和效率的持续投入。
对于使用 PyTorch 进行模型训练和推理的企业,性能分析工具的改进可能降低优化成本,提升开发效率,但具体价值取决于这些改动在实际工作负载中的表现。
后续可关注 Kineto 是否发布正式版本,以及这些改进是否被整合到 PyTorch 的稳定版本中,从而影响更广泛的用户。