DLRMv4: The Next-Generation Recommendation MLPerf Training Benchmark
MLCommons 发布 DLRMv4,作为下一代推荐系统 MLPerf Training 基准。该基准将 MLPerf Training 从特征交互基线演进到生产级序列推荐,采用 HSTU,并包含 560 GB 的 Yambda-5B 嵌入基准。
Development
- First ReportDLRMv4: The Next-Generation Recommendation MLPerf Training BenchmarkMLCommons
- Current Assessment若生产级序列推荐成为 MLPerf Training 的正式评测项,推荐模型训练的硬件与系统对比将更贴近实际部署负载,而非仅比较特征交互类基线。可验证下一信号:首批提交结果中出现的厂商与加速器组合。Agent Pulse · analysis
MLCommons 发布 DLRMv4,定位为下一代推荐 MLPerf Training 基准。据其说明,该基准把 MLPerf Training 从特征交互基线推进到生产级序列推荐,使用 HSTU,并引入 560 GB 的 Yambda-5B 嵌入基准。这标志着推荐系统训练评测的负载形态与数据规模设定发生变化。
从描述看,评测重心由特征交互转向序列推荐,并引入 HSTU 与 560 GB 嵌入规模,意味着内存容量与嵌入访问模式可能成为训练评测的关键约束。可验证下一信号:官方是否公布该基准的参考实现、运行规则与内存/吞吐指标口径。
若生产级序列推荐成为 MLPerf Training 的正式评测项,推荐模型训练的硬件与系统对比将更贴近实际部署负载,而非仅比较特征交互类基线。可验证下一信号:首批提交结果中出现的厂商与加速器组合。
对采购训练硬件的团队而言,该基准提供了更接近生产推荐负载的对比维度,有助于评估大嵌入表场景下的性价比。可验证下一信号:厂商是否在提交中披露 DLRMv4 的吞吐与成本数据。
后续可观察 DLRMv4 是否被主流训练框架与硬件厂商纳入常规提交,以及 Yambda-5B 规模是否进一步上调。可验证下一信号:MLCommons 公布的首轮 DLRMv4 结果榜单。