viable/strict/1789802803: [distributed] Shorten deleted-key store timeout (#197631)
PyTorch 合并 PR #197631,针对分布式测试中已删除键的 get 操作,将超时从两秒缩短为一毫秒,并在成功操作前恢复原两秒预算,保留断言与两种 TCP 后端。测试计划显示源码构建与定向 lint 通过,基线耗时 4.102 秒对比 0.090 秒,构建后三次重复测试通过。
Development
- First Reportviable/strict/1789802803: [distributed] Shorten deleted-key store timeout (#197631)PyTorch Core
- Current Assessment此类改动反映大型开源项目在 CI 成本上的持续优化:分布式测试的等待时间被逐项压缩。它不改变 PyTorch 对外能力,但会缩短贡献者的反馈周期。可验证下一信号:关注 PyTorch CI 整体时长或 flaky 测试统计是否随之变化。Agent Pulse · analysis
PyTorch 仓库合并 PR #197631,标题为 [distributed] Shorten deleted-key store timeout。改动逻辑是:仅对已删除键的 get 使用一毫秒超时,在成功操作前恢复原本的两秒预算,同时保留断言与两种 TCP 后端。测试计划记录源码构建与定向 lint 通过,两项测试通过,基线 4.102 秒对 0.090 秒,构建后三次重复测试通过。该 PR 由 pytorchgreenlight 批准,并依赖 #197629 与 #197630。
这是测试基础设施层面的超时参数调整,而非分布式存储语义变更。把已删除键的 get 超时压到一毫秒,说明该路径预期快速失败,而成功路径仍保留两秒预算,避免误伤正常操作。可验证下一信号:观察后续 PR 是否把该超时抽成可配置项,或是否出现因一毫秒过短导致的偶发失败报告。
此类改动反映大型开源项目在 CI 成本上的持续优化:分布式测试的等待时间被逐项压缩。它不改变 PyTorch 对外能力,但会缩短贡献者的反馈周期。可验证下一信号:关注 PyTorch CI 整体时长或 flaky 测试统计是否随之变化。
对使用 PyTorch 分布式训练栈的团队,直接收益有限,主要是上游测试更快、回归更早暴露。可验证下一信号:跟踪该 PR 后续是否被 cherry-pick 到发布分支,以及相关测试在夜间 CI 中的失败率。
若该模式被推广,更多分布式测试中的固定超时可能被替换为按路径区分的短超时。需要观察是否出现回滚或超时上调的后续提交,以判断一毫秒是否稳定。