ReToken: One Token to Improve Vision-Language Models for Visual Retrieval
ReToken 是一个可学习的嵌入,作为显式检索目标,从预填充的视觉 KV 缓存中选择与查询相关的稀疏视觉 token。在 Visual Haystacks 上,Qwen3VL-8B 提升 13.4 分,InternVL3.5 提升 12.4 分;在 LVBench 上零样本迁移至长视频,Qwen3VL-8B 提升 8.0 分。训练和长视频推理可在单个 H100 上完成。代码已开源。
Development
- First ReportReToken: One Token to Improve Vision-Language Models for Visual RetrievalarXiv cs.AI
- Current AssessmentReToken 展示了通过轻量级插件提升现有视觉语言模型长上下文能力的路径,无需重新训练整个模型。这暗示了未来模型可能采用模块化设计,通过附加检索或压缩模块来扩展上下文长度。对于视觉检索和视频理解领域,这种方法可能降低长视频处理的计算门槛,使更多团队能够在有限资源下进行长视频推理。Agent Pulse · analysis
ReToken 是一种轻量级方法,通过单个可学习嵌入作为检索目标,从预填充的视觉 KV 缓存中选择与查询相关的稀疏视觉 token,以解决长视觉上下文中视觉语言模型性能下降和 GPU 内存限制的问题。在仅使用小型图像 QA 数据集训练后,ReToken 在图像和视频基准上均取得一致提升:在 Visual Haystacks 上,Qwen3VL-8B 提升 13.4 分,InternVL3.5 提升 12.4 分(相对提升超过 20%);在 LVBench 上,零样本迁移至长视频,Qwen3VL-8B 提升 8.0 分。由于设计轻量,训练和长视频推理均可在单个 H100 上完成。代码已开源。
ReToken 的核心创新在于将检索目标显式建模为可学习嵌入,而非依赖隐式注意力。通过从预填充的 KV 缓存中选择稀疏 token,它避免了处理全部 token 的计算开销,同时保持了与查询的相关性。这种方法在小型数据集上训练即可获得显著提升,表明检索目标的可学习性可能比大规模训练数据更重要。下一步可验证的信号包括:ReToken 在不同模型规模上的泛化能力,以及它是否能在更长上下文(如数小时视频)中保持性能。
ReToken 展示了通过轻量级插件提升现有视觉语言模型长上下文能力的路径,无需重新训练整个模型。这暗示了未来模型可能采用模块化设计,通过附加检索或压缩模块来扩展上下文长度。对于视觉检索和视频理解领域,这种方法可能降低长视频处理的计算门槛,使更多团队能够在有限资源下进行长视频推理。
ReToken 降低了长视频推理的硬件门槛,使单个 H100 即可完成训练和推理,这可能降低视觉检索和视频理解应用的成本。对于提供视频分析、多模态搜索等服务的公司,采用此类方法可能提升效率并降低成本。开源代码进一步降低了采用门槛,可能加速其在行业中的应用。
ReToken 的零样本迁移能力表明,它可能适用于更广泛的长视频理解任务。未来可观察其是否被集成到主流视觉语言模型中,以及是否会出现基于类似思想的更高效检索机制。此外,其在更长上下文(如数小时视频)上的表现值得关注。