Mixture-of-Translators: Translating KV Caches Across Heterogeneous Large Language Models
Mixture-of-Translators (MoT) 是一个缓存翻译框架,用于将源 LLM 的 KV 缓存映射到目标 LLM 的缓存空间。它使用多个翻译器模块,并引入上下文校正损失以减少残差翻译误差。MoT 解决了传播平移和最后状态平移两种失败模式。实验在 Qwen2.5 等模型上进行。
发展脉络
- 首次出现Mixture-of-Translators: Translating KV Caches Across Heterogeneous Large Language ModelsarXiv cs.CL
- 当前判断该研究针对多模型系统中的缓存复用问题,可能降低多模型推理和长上下文生成的计算成本。如果 MoT 被广泛采用,可能改变模型服务架构,减少重复预填充。可验证的下一信号:是否有主流推理框架(如 vLLM、TensorRT-LLM)集成 MoT 或类似技术。Agent Pulse · 分析
Mixture-of-Translators (MoT) 提出了一种跨异构 LLM 的 KV 缓存翻译框架。在异构 LLM 系统中,共享上下文、检索证据和多智能体对话历史导致每个模型需要重复预填充或存储缓存,限制了多模型推理和长上下文生成的扩展性。MoT 通过多个翻译器模块捕获不同的源-目标映射,并引入上下文校正损失来对齐重放的目标轨迹与原生目标轨迹。它揭示了缓存翻译中的两种竞争性失败模式:早期注入导致的传播平移和晚期注入导致的最后状态平移。MoT 通过翻译器混合和目标侧校正来解决这些问题。实验在 Qwen2.5 等模型上进行,展示了同构和异构翻译的效果。
MoT 的核心创新在于使用多个翻译器模块而非单一投影路径,以捕获源-目标映射的多样性。上下文校正损失通过对齐重放轨迹与原生轨迹来减少残差误差。识别出的两种失败模式(传播平移和最后状态平移)为缓存翻译提供了理论指导。可验证的下一信号:MoT 是否能在更大规模模型(如 70B+)上保持翻译质量,以及翻译后的缓存对下游任务(如推理、多智能体)的准确率影响。
该研究针对多模型系统中的缓存复用问题,可能降低多模型推理和长上下文生成的计算成本。如果 MoT 被广泛采用,可能改变模型服务架构,减少重复预填充。可验证的下一信号:是否有主流推理框架(如 vLLM、TensorRT-LLM)集成 MoT 或类似技术。
MoT 通过减少重复预填充和缓存存储,可能显著降低多模型推理的运营成本。对于提供多模型服务的平台,这能提升资源利用率和响应速度。可验证的下一信号:是否有云服务商或 AI 公司采用 MoT 并报告成本节省。
MoT 可能推动跨模型缓存共享成为标准实践,特别是在多智能体系统和检索增强生成中。未来可能扩展到跨模态或跨语言模型。可验证的下一信号:MoT 是否在真实生产环境中部署,以及是否出现基于 MoT 的商业服务。