ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs
ET-Prune 是一个免训练的视觉 token 剪枝框架,将剪枝建模为证据分配。它从解码器侧的部分 query-key 块推导问题条件证据,保护文本类空间区域,并将证据不确定性和密度转化为样本特定的 token 下限。三个渐进式中间层事件将序列推向该预算,对分散或文本密集证据保留更多 token,对集中证据更激进剪枝。在六个骨干-基准组合中,ET-Prune 在约一半 token 下领先或持平于其他剪枝方法。在 OCRBench-v2 上,它在 Qwen3-VL-8B 和 InternVL3.5-8B 上分别领先最强剪枝基线 1.80 和 0.68 个百分点。
发展脉络
- 首次出现ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMsarXiv cs.CL
- 当前判断ET-Prune 表明,针对特定输入类型(如文本丰富)的动态剪枝策略可能比通用固定比例剪枝更有效。这暗示多模态模型推理优化正从通用方法转向任务自适应方法。可验证的下一信号是:是否有更多研究采用类似证据分配思路,或商业模型集成此类动态预算机制。Agent Pulse · 分析
ET-Prune 提出了一种免训练的视觉 token 剪枝框架,针对文本丰富输入中固定 token 比例不匹配的问题。该框架将剪枝视为证据分配,从解码器侧部分 query-key 块推导问题条件证据,保护文本区域,并将证据不确定性和密度转化为样本特定 token 下限。通过三个渐进式中间层事件,ET-Prune 在保留分散或文本密集证据的同时,对集中证据进行更激进剪枝。在六个骨干-基准组合中,ET-Prune 在约一半 token 下领先或持平于其他剪枝方法。在 OCRBench-v2 上,它在 Qwen3-VL-8B 和 InternVL3.5-8B 上分别领先最强剪枝基线 1.80 和 0.68 个百分点。
ET-Prune 的核心创新在于将剪枝从固定比例转变为基于证据的动态分配,通过解码器侧部分 query-key 块推导问题条件证据,并保护文本区域。这种方法在文本密集任务中更有效,因为它避免了盲目剪枝导致的关键证据丢失。可验证的下一信号是:在更多文本丰富基准(如文档理解)上的表现,以及与其他动态剪枝方法的对比。
ET-Prune 表明,针对特定输入类型(如文本丰富)的动态剪枝策略可能比通用固定比例剪枝更有效。这暗示多模态模型推理优化正从通用方法转向任务自适应方法。可验证的下一信号是:是否有更多研究采用类似证据分配思路,或商业模型集成此类动态预算机制。
ET-Prune 通过减少 token 数量降低推理成本,同时保持或提升文本丰富任务性能,对多模态模型部署有直接价值。它可能使 OCR 和文档理解应用更经济高效。可验证的下一信号是:是否有云服务或推理平台采用类似动态剪枝技术来降低 API 成本。
ET-Prune 可能推动视觉 token 剪枝向更细粒度的证据感知方向发展,尤其是在 OCR 和文档理解任务中。未来可能看到更多结合任务特定信息的剪枝方法,以及将动态预算集成到推理框架中。可验证的下一信号是:ET-Prune 是否在更多模型和基准上被复现,以及是否出现基于证据分配的商业化工具。