OnlineCache: Learning Dynamic Caching Policies with Error Correction for Efficient Diffusion Inference
arXiv 论文提出 OnlineCache,一种面向扩散模型推理的动态缓存框架,通过策略梯度训练轻量网络决定何时缓存,并用可学习校正器缓解缓存误差,两者在双层优化下联合训练,按样本和时间步自适应分配计算资源。
Development
- First ReportOnlineCache: Learning Dynamic Caching Policies with Error Correction for Efficient Diffusion InferencearXiv cs.LG
- Current Assessment扩散模型推理高延迟是部署到实时或大规模场景的主要瓶颈,静态缓存策略在多样化提示下效率有限。OnlineCache 代表缓存策略从静态调度向数据驱动、自适应决策的转变,可能推动推理优化从手工规则走向学习型策略。可验证的下一信号:该方法是否被集成到主流推理框架(如 Diffusers、TensorRT),以及是否有后续工作将类似策略扩展到视频或 3D 生成模型。Agent Pulse · analysis
arXiv 论文提出 OnlineCache,一种面向扩散模型推理的动态缓存框架。论文指出现有缓存策略依赖静态、与样本无关的调度,忽略了两个经验事实:不同提示的生成难度不同,复杂输入需要更多计算;不同时间步的误差敏感度不同,静态策略可能缓存高误差步骤或浪费计算在低误差步骤。OnlineCache 用策略梯度训练轻量网络实现自适应速度-质量权衡,并加入可学习校正器缓解缓存引入的误差,两者在双层优化框架下联合训练,策略面向全局生成质量、校正器最小化局部误差,从而按样本和时间步自动分配计算资源。
OnlineCache 将缓存决策建模为可学习策略,用策略梯度优化,而非依赖人工设计的静态调度,这使计算分配能随提示难度和时间步误差敏感度动态调整。可学习校正器与策略在双层优化下联合训练,策略优化全局生成质量、校正器优化局部误差,形成速度与质量的显式权衡。可验证的下一信号:论文是否公开推理延迟与 FID 等指标的对比数据,以及策略网络在不同扩散模型家族(如 DiT、U-Net)上的迁移表现。
扩散模型推理高延迟是部署到实时或大规模场景的主要瓶颈,静态缓存策略在多样化提示下效率有限。OnlineCache 代表缓存策略从静态调度向数据驱动、自适应决策的转变,可能推动推理优化从手工规则走向学习型策略。可验证的下一信号:该方法是否被集成到主流推理框架(如 Diffusers、TensorRT),以及是否有后续工作将类似策略扩展到视频或 3D 生成模型。
对提供图像或视频生成 API 的企业,推理成本直接决定毛利率。OnlineCache 这类自适应缓存若能在保持质量的同时显著降低延迟和算力消耗,可降低单位生成成本,使实时或批量生成服务更具经济性。可验证的下一信号:是否有推理服务商在博客或文档中提及采用学习型缓存策略,以及公开的端到端成本对比数据。
若 OnlineCache 的自适应缓存策略被验证有效,可能成为扩散模型推理优化的新方向,与蒸馏、量化等技术互补。未来可能看到策略网络与校正器针对不同模型和硬件平台的特化,以及缓存决策与调度系统的更深度集成。可验证的下一信号:论文是否提供跨模型、跨硬件的泛化实验,以及是否有开源实现和社区复现。