When Does Latent Communication Pay? A Causal Audit of Relayed KV Caches in Multi-Agent LLMs
arXiv 论文 2608.04893v1 对多智能体 LLM 系统中继 KV 缓存的效果进行因果审计。在接收方需要发送方私有信息的场景下,主骨干上答案相关中继的准确率为 100%,而答案无关中继为 23-25%,该对比在三个模型家族、五个检查点和文档问答任务上复现。在不需要私有信息的场景下,预注册的五种子协议在 GSM8K 和 ARC-Challenge 上(三个 Qwen3 规模)以及 MedQA 8B 上,经 Holm 校正的 TOST 检验显示等效性在 2.8 分以内;另一模型家族未检测到优势。在一个自然单元中,将缓存置零导致 14.7 分的下降,而错配缓存仅下降 0.4 分。
Development
- First ReportWhen Does Latent Communication Pay? A Causal Audit of Relayed KV Caches in Multi-Agent LLMsarXiv cs.LG
- Current Assessment多智能体 LLM 系统常通过中继 KV 缓存来提升效率,但该研究提示其收益可能被高估,尤其是在接收方不需要私有信息的场景下。这可能导致行业对缓存中继技术的投资和部署策略调整,转向更精确的信息传递机制。可验证的下一信号:主流多智能体框架(如 AutoGen、LangGraph)是否会引入基于信息需求的中继决策。Agent Pulse · analysis
该论文对多智能体 LLM 系统中继 KV 缓存(而非文本)的收益进行因果审计,质疑其收益归因于交换的“潜在思想”。作者通过将缓存替换为错配示例、置零和矩匹配随机版本,在两种条件下进行实验:接收方是否需要发送方的私有信息。当需要时,答案相关中继达到 100% 准确率,而答案无关中继仅 23-25%,该对比在三个模型家族、五个检查点和文档问答任务上复现。当不需要时,预注册的五种子协议在 GSM8K、ARC-Challenge(三个 Qwen3 规模)和 MedQA 8B 上建立等效性(差异在 2.8 分以内),另一家族未检测到优势。关键发现是:大的缓存效应不一定是配对效应——在一个自然单元中,置零缓存导致 14.7 分下降,而错配缓存仅 0.4 分。
该审计表明,KV 缓存中继的收益可能并非源于缓存内容与接收方任务的语义匹配,而是源于缓存中携带的私有信息。当接收方需要该信息时,中继效果显著;当不需要时,效果与随机缓存等效。这提示多智能体通信的设计应关注信息需求,而非盲目中继缓存。可验证的下一信号:后续研究是否会在更多任务和模型上复现“需要私有信息时中继有效,否则无效”的模式,并探索动态决定是否中继的机制。
多智能体 LLM 系统常通过中继 KV 缓存来提升效率,但该研究提示其收益可能被高估,尤其是在接收方不需要私有信息的场景下。这可能导致行业对缓存中继技术的投资和部署策略调整,转向更精确的信息传递机制。可验证的下一信号:主流多智能体框架(如 AutoGen、LangGraph)是否会引入基于信息需求的中继决策。
对于构建多智能体系统的公司,该研究提示缓存中继的收益可能因场景而异,盲目采用可能导致性能未达预期。这影响系统设计决策和成本效益分析。可验证的下一信号:企业是否在智能体系统中采用更精细的通信策略,并报告性能变化。
未来,多智能体系统可能不再盲目中继缓存,而是根据接收方的信息需求动态决定是否中继或如何转换缓存。这可能导致更高效的通信协议和更可解释的智能体协作。可验证的下一信号:出现基于信息需求的中继策略的论文或开源实现。