Where the Industry Is Investing: A Look at MLPerf Inference v6.1
MLCommons 发布 MLPerf Inference v6.1 结果分析,由 MLPerf Inference 工作组主席 Miro Hodak 与 Frank Han 撰写。文中提到本轮共有 30 家提交方、120 个系统,规模创纪录,并首次引入 agentic 与端到端(end-to-end)基准。文章称这些结果反映推理工程的发展方向。
Development
- First ReportWhere the Industry Is Investing: A Look at MLPerf Inference v6.1MLCommons
- Current Assessment30 家提交方、120 个系统的规模说明推理性能评测仍是多方共同投入的竞争场,参与面扩大通常意味着硬件与软件栈厂商都希望在该榜单上获得可比位置。但证据未披露各提交方名单与结果分布,无法判断集中度或领先者。可验证下一信号:官方结果表中提交方构成与系统类型(加速器、云实例、边缘设备)的比例变化。Agent Pulse · analysis
MLCommons 于 2026 年 9 月 17 日发布 MLPerf Inference v6.1 的结果解读,作者为 MLPerf Inference 工作组主席 Miro Hodak 和 Frank Han。据该文,本轮提交方达 30 家、系统达 120 个,为历史最多;同时新增 agentic 与端到端基准。文章定位为分析性内容,讨论这些结果对推理工程走向的信号意义,而非单一厂商的产品发布。
若 agentic 与端到端基准确被纳入,评测重心可能从单次推理延迟/吞吐转向多步调用与整条流水线的完成时间,这会改变优化目标与瓶颈位置。但证据未给出具体指标定义、任务集或数值,因此只能视为方向性判断。可验证下一信号:MLPerf 公开的基准规则文档中是否出现 agentic 场景的明确任务定义与计分口径。
30 家提交方、120 个系统的规模说明推理性能评测仍是多方共同投入的竞争场,参与面扩大通常意味着硬件与软件栈厂商都希望在该榜单上获得可比位置。但证据未披露各提交方名单与结果分布,无法判断集中度或领先者。可验证下一信号:官方结果表中提交方构成与系统类型(加速器、云实例、边缘设备)的比例变化。
对采购与选型方而言,评测口径从单点推理扩展到端到端链路,可能使对比维度更贴近实际部署成本,但当前证据不足以支撑任何具体成本或性能结论。可验证下一信号:官方是否公布端到端基准的计分方式及可复现的参考实现。
若 agentic 与端到端基准持续迭代,推理评测可能逐步覆盖更长链路与工具调用场景,进而影响采购与选型时的对比口径。这仍是趋势判断,需以后续版本的基准定义与结果发布为验证。