LLM Inference Under Bursty Workload Distribution: Modifying the WAIT Algorithm
arXiv 论文提出对 WAIT 调度算法的轻量扩展,通过在线估计请求到达强度来适应时变到达率,无需先验流量知识。基于 MMPP 合成工作负载的仿真评估显示,在评估的低到达率偏移场景下,该方法相比 Sarathi-Serve、ORCA 和 vLLM 实现了更高吞吐量,同时保持可比延迟。
Development
- First ReportLLM Inference Under Bursty Workload Distribution: Modifying the WAIT AlgorithmarXiv cs.LG
- Current Assessment真实 LLM 推理流量具有突发性,静态调度假设可能导致资源浪费或延迟增加。该研究提示推理服务提供商需关注流量动态性,自适应调度可能成为提升吞吐和降低成本的关键方向。Agent Pulse · analysis
该论文针对 LLM 推理调度中假设泊松到达率恒定、无法反映真实突发流量的局限,提出对 WAIT 算法的轻量扩展。算法基于观测到的到达间隔时间在线估计请求强度,适应时变到达率。仿真使用 MMPP 合成工作负载和多种请求类型,结果显示在低到达率偏移场景下,该方法吞吐量高于 Sarathi-Serve、ORCA 和 vLLM,延迟相当。
该工作表明,LLM 推理调度算法正从静态泊松假设转向自适应在线估计。WAIT 扩展通过到达间隔时间估计请求强度,无需先验流量知识,为突发流量下的调度提供了新思路。但评估限于低到达率偏移场景,高突发或极端流量下的表现未知。
真实 LLM 推理流量具有突发性,静态调度假设可能导致资源浪费或延迟增加。该研究提示推理服务提供商需关注流量动态性,自适应调度可能成为提升吞吐和降低成本的关键方向。
对推理服务提供商,自适应调度可在不牺牲延迟下提升吞吐,降低单位请求成本。对云厂商,可提高 GPU 利用率,减少闲置资源,增强竞争力。
后续可关注该算法在高突发场景、真实流量数据下的验证,以及是否被主流推理框架(如 vLLM)采纳。若验证有效,可能推动调度算法从静态向自适应演进。