AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年7月9日 · SMetric

SMetric: Rethink LLM Scheduling for Serving Agents with Balanced Session-centric Scheduling

发生了什么

arXiv 论文 SMetric 提出以会话为中心的调度方法,用于服务 Agent 工作负载,目标是平衡会话间资源分配并优化集群吞吐量。

EVENT STORY

发展脉络

  1. 首次出现SMetric: Rethink LLM Scheduling for Serving Agents with Balanced Session-centric SchedulingarXiv cs.AI
  2. 当前判断随着 Agent 工作负载增长,推理基础设施的调度策略需要从面向人类交互转向面向 Agent 吞吐量优化。这可能导致调度器设计的新方向,并影响推理服务提供商的成本与性能。Agent Pulse · 分析
改变了什么

arXiv 论文 SMetric 重新思考 LLM 调度以服务 Agent 工作负载。论文指出,Agent 发出的请求与人类不同:Agent 仅在收到完整响应后才行动,因此集群的每秒 token 数(TPS)成为主要目标,同时放宽了首 token 延迟等约束。现有调度设计可能不适合这种工作负载。SMetric 提出以会话为中心的调度方法,旨在平衡会话间的资源分配,从而在 Agent 场景下优化集群吞吐量。

能力边界怎么变了

SMetric 表明,面向人类交互优化的调度策略(如优先降低首 token 延迟)在 Agent 工作负载下可能次优。Agent 场景中,TPS 成为主要优化目标,调度器应关注会话级资源平衡而非单个请求。这提示调度设计需针对 Agent 特性重新校准。

为什么重要

随着 Agent 工作负载增长,推理基础设施的调度策略需要从面向人类交互转向面向 Agent 吞吐量优化。这可能导致调度器设计的新方向,并影响推理服务提供商的成本与性能。

对谁有影响

对推理服务提供商,采用会话级调度可提升 Agent 场景下的吞吐量,降低单位 token 成本,增强竞争力。

接下来观察

后续可关注 SMetric 的实证结果或开源实现,以及主流推理服务是否采用会话级调度策略。