What We Observe as LLM Behavior Can Be a Side-effect of Inference Backend
arXiv 论文 2608.04714v1 报告,在三个指令微调模型、五个推理框架、六个基准和四种生成模式的交叉研究中,发现推理后端(如 HuggingFace、vLLM、Ollama)对模型输出有显著影响,即使贪婪解码下也能改变性能,且约 39% 的变异性可归因于后端。
发展脉络
- 首次出现What We Observe as LLM Behavior Can Be a Side-effect of Inference BackendarXiv cs.LG
- 当前判断行业基准比较可能因后端选择而产生偏差,模型排名可能不稳定。这促使社区需要标准化推理配置或披露后端细节,以提升评测可信度。Agent Pulse · 分析
一篇 arXiv 论文(2608.04714v1)指出,基准分数通常被视为模型属性,但用于生成分数的推理框架(如 HuggingFace、vLLM、Ollama)几乎从不披露,被认为无影响。研究通过完全交叉设计(3 个指令微调模型 × 5 个推理框架 × 6 个基准 × 4 种生成模式)发现,后端是一个不可忽略的因素:即使在贪婪解码(无采样噪声)下,更换后端也能显著改变模型性能,且这种效应是结构性的、强烈依赖模型。方差分解显示,约 39% 的开箱即用变异性来自后端,其余来自采样噪声和框架默认生成参数,后者可通过披露和匹配生成配置来避免。
推理后端(如 vLLM、HuggingFace、Ollama)的数值实现差异(如内核、精度、采样逻辑)会导致模型输出显著变化,即使贪婪解码下也如此。约 39% 的变异性来自后端,意味着基准分数不能仅归因于模型权重。
行业基准比较可能因后端选择而产生偏差,模型排名可能不稳定。这促使社区需要标准化推理配置或披露后端细节,以提升评测可信度。
对模型供应商和推理平台而言,后端选择影响基准分数,进而影响营销和客户决策。优化后端可能成为提升模型竞争力的一种手段。
未来评测报告可能要求披露推理框架及版本,并可能催生跨后端的标准化评测协议。