AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年9月10日 · Amazon SageMaker Inference

Reduce LLM latency with prefix-aware routing on Amazon SageMaker Inference

发生了什么

Amazon SageMaker Inference 推出 prefix-aware routing,将共享相同 prompt 前缀的请求路由到同一实例,以保持 KV cache 命中。AWS 称在 Llama 3.1 70B 基准中,P50 首 token 时延最多降低 77%,KV cache 命中率从约 25% 提升到 80% 以上。

EVENT STORY

发展脉络

  1. 首次出现Reduce LLM latency with prefix-aware routing on Amazon SageMaker InferenceAWS Machine Learning Blog
  2. 当前判断托管推理的竞争点正从单纯算力供给转向调度与缓存效率,云厂商开始把推理优化做成平台默认能力而非用户自建。若该策略被其他托管推理服务跟进,前缀复用率可能成为衡量推理平台性价比的新维度。判断依据仅为 AWS 单方基准,尚无第三方复现。Agent Pulse · 分析
改变了什么

AWS Machine Learning Blog 发布文章,介绍 Amazon SageMaker Inference 的 prefix-aware routing:该路由策略把共享同一 prompt 前缀的请求发送到同一实例,使 KV cache 保持热态。文中给出的基准基于 Llama 3.1 70B,P50 time-to-first-token 最多下降 77%,KV cache 命中率由约 25% 升至 80% 以上。证据未披露实现细节、支持模型范围、区域可用性或定价信息。

能力边界怎么变了

从机制看,这是把缓存亲和性从单实例内部提升为路由层决策:相同前缀命中同一实例,可减少重复 prefill 计算。但收益高度依赖流量中前缀的重复度与路由一致性,长尾或高度多样化的 prompt 可能收益有限。可验证的下一信号是 AWS 是否公布路由键的构造方式、缓存失效与负载均衡冲突时的降级策略,以及非共享前缀场景下的时延回归数据。

为什么重要

托管推理的竞争点正从单纯算力供给转向调度与缓存效率,云厂商开始把推理优化做成平台默认能力而非用户自建。若该策略被其他托管推理服务跟进,前缀复用率可能成为衡量推理平台性价比的新维度。判断依据仅为 AWS 单方基准,尚无第三方复现。

对谁有影响

对使用托管推理的团队,前缀复用率高的场景(固定系统提示、共享上下文、多轮同源请求)可能直接降低首 token 时延与单位推理成本;前缀分散的场景收益不确定。建议先测量自身流量的前缀重复分布,再决定是否依赖该路由策略,而非直接按 77% 做容量规划。

接下来观察

可观察的下一信号包括:SageMaker 是否将该路由扩展到更多模型与区域、是否公开与 prompt caching 类功能的组合效果,以及第三方对 77% 时延降幅的独立复现。若复现成立,前缀感知路由可能成为托管 LLM 推理的常规配置项。