NCCL v2.31.2-1 Release
NCCL v2.31.2-1 发布,新增 Compute Fabric Transport (CFT) 主机和设备 API,支持在 Blackwell GPU 上使用 CUDA Toolkit 13.3 或更高版本。引入 ncclCollConfig_t 类型和 nccl*Config API,支持按集合配置算法、CTA/CGA 大小和 CTA 策略。GIN 增强包括 EFA GDA 后端(由 AWS EFA 团队贡献)、每 DevComm 后端选择、设备端超时、减少 QP 使用和文件描述符消耗,以及基于事件的 CQ 错误报告。
Development
- First ReportNCCL v2.31.2-1 ReleaseNVIDIA NCCL Releases
- Current AssessmentNCCL 作为 GPU 集群通信的事实标准,其更新反映了大规模 AI 训练对通信效率和可配置性的需求。AWS EFA 团队的贡献表明云提供商与硬件厂商在通信栈上的合作加深。按集合配置和 CFT 支持可能影响未来 AI 基础设施的设计,特别是在多租户和异构集群场景下。Agent Pulse · analysis
NVIDIA 发布了 NCCL v2.31.2-1,这是一个重要的通信库更新。主要新特性包括:1) Compute Fabric Transport (CFT) 支持,提供主机和设备 API 用于注册窗口内存,并支持设备端 Put、Get 和 NVLS 操作,适用于 Blackwell GPU 和 CUDA Toolkit 13.3+。2) 按集合配置和调优,新增 ncclCollConfig_t 类型和 nccl*Config API,允许为每个集合选择算法、覆盖 CTA/CGA 大小和 CTA 策略,并支持自定义 fork 集成。3) GIN 增强,包括 AWS EFA 团队贡献的 EFA GDA 后端,支持 GIN Put、Signal 和 Flush 操作;每 DevComm 后端选择;自定义 strides;设备端超时;减少 QP 使用和文件描述符消耗;以及基于事件的 CQ 错误报告。这些改进旨在提升大规模 GPU 集群的通信效率和可配置性。
NCCL 引入的按集合配置 API 允许用户为不同集合操作指定算法和 CTA/CGA 大小,这为性能调优提供了更细粒度的控制。CFT 支持设备端操作可能减少主机参与,降低延迟。GIN 的 EFA GDA 后端和减少 QP 使用有助于提高可扩展性。设备端超时和事件驱动的 CQ 错误报告增强了可靠性。这些变化表明 NCCL 正在向更灵活、更高效的通信架构演进。
NCCL 作为 GPU 集群通信的事实标准,其更新反映了大规模 AI 训练对通信效率和可配置性的需求。AWS EFA 团队的贡献表明云提供商与硬件厂商在通信栈上的合作加深。按集合配置和 CFT 支持可能影响未来 AI 基础设施的设计,特别是在多租户和异构集群场景下。
对于使用 NVIDIA GPU 进行大规模训练的企业,NCCL 的更新可能降低通信开销,提升训练效率,从而减少训练时间和成本。按集合配置允许针对特定工作负载优化,可能带来显著的性能提升。GIN 增强有助于在云环境中更高效地使用网络资源。
后续可关注 NCCL 对 CFT 的进一步优化、按集合配置在真实训练工作负载中的性能表现,以及 GIN 后端在更多云环境中的采用。这些特性可能推动通信库向更模块化、可编程的方向发展。