AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年10月2日 · Arize AI

Prompt caching benchmark: high cache reuse doesn’t always mean lower cost

发生了什么

Arize AI 发布了一篇 prompt caching 基准测试文章,标题为「Prompt caching benchmark: high cache reuse doesn't always mean lower cost」。文章称其使用 Harbor evals 与 Phoenix traces,在同一个多轮购物助手 agent 上对比 DeepSeek、GLM、GPT 与 Claude 的缓存复用、估算成本与延迟。

EVENT STORY

发展脉络

  1. 首次出现Prompt caching benchmark: high cache reuse doesn’t always mean lower costArize AI Blog
  2. 当前判断若该结论成立,则「缓存命中率」作为成本优化 KPI 可能被误用,供应商的缓存定价结构会成为选型变量。可验证的下一信号是其他评测方或模型厂商是否在同一多轮 agent 场景下给出可比的成本口径。Agent Pulse · 分析
改变了什么

Arize AI 在其博客发布 prompt caching 基准测试,覆盖 DeepSeek、GLM、GPT 与 Claude 四类模型。测试方法为在同一个多轮购物助手 agent 场景下,借助 Harbor evals 与 Phoenix traces 采集数据,比较缓存复用率、估算成本与延迟三项指标。文章标题给出的核心结论是:高缓存复用并不总是意味着更低成本。证据未披露具体模型版本、缓存命中率数值、成本差异幅度或延迟数据。

能力边界怎么变了

标题结论指向一个可检验的工程假设:缓存复用率与端到端成本之间并非单调关系,成本还受缓存写入定价、失效策略与多轮上下文增长方式影响。可验证的下一信号是 Arize 是否公开各模型的缓存命中率、写入与读取计费口径及延迟分布,以便复现该结论。

为什么重要

若该结论成立,则「缓存命中率」作为成本优化 KPI 可能被误用,供应商的缓存定价结构会成为选型变量。可验证的下一信号是其他评测方或模型厂商是否在同一多轮 agent 场景下给出可比的成本口径。

对谁有影响

对使用多轮 agent 的团队,该结论提示不能仅凭缓存复用率做成本决策,需按实际计费口径核算。可验证的下一信号是团队在自身流量上复现缓存复用与账单成本的相关性。

接下来观察

短期内 prompt caching 的评估口径可能从单一命中率转向包含写入成本与延迟的复合指标。可验证的下一信号是 Arize 是否发布完整数据集与复现脚本,或厂商是否调整缓存计费说明。