2026年7月28日 · OmniDelta
OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs
OmniDelta 是一种无需训练的、技能驱动的 token 压缩框架,用于 OmniLLM。它通过意图感知的模态间分配和内容感知的模态内分配,在保持总保留 token 比率的同时重新分配预算。实验在四个音视频基准上使用 Qwen2 模型进行。
EVENT STORY
发展脉络
- 首次出现OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMsarXiv cs.AI
- 当前判断该工作表明,多模态大模型的 token 压缩正从固定预算下的重要 token 选择转向预算分配优化,这可能是降低推理成本的关键方向。Agent Pulse · 分析
OmniDelta 是一种无需训练的、技能驱动的 token 压缩框架,用于 OmniLLM。它通过意图感知的模态间分配和内容感知的模态内分配,在保持总保留 token 比率的同时重新分配预算。实验在四个音视频基准上使用 Qwen2 模型进行。
OmniDelta 通过构建音频和视频技能池,根据查询需求重新分配固定保留 token 预算,并利用局部复杂度和时间冗余在音频片段和视频帧之间重新分配模态预算。该方法可与现有剪枝策略结合,改变预算分配位置而不改变总保留 token 比率。
该工作表明,多模态大模型的 token 压缩正从固定预算下的重要 token 选择转向预算分配优化,这可能是降低推理成本的关键方向。
对于部署多模态大模型的企业,OmniDelta 提供了一种无需训练的推理优化方法,可降低内存和计算成本,从而降低运营成本。
未来可观察 OmniDelta 是否被集成到主流 OmniLLM 推理框架中,以及是否有其他工作提出更高效的预算分配策略。