DenseOn with the LateOn: Fully Open Dense and Late-Interaction Models for Multilingual, Long-Context, and Code Search
DenseOn 和 LateOn 是 149M 参数的检索模型,在 BEIR 上分别达到 56.20 和 57.22 平均 nDCG@10,创该规模新 SOTA。mDenseOn 和 mLateOn 是 307M 参数的多语言模型,基于 mmBERT-base,使用翻译训练数据。
Development
- First ReportDenseOn with the LateOn: Fully Open Dense and Late-Interaction Models for Multilingual, Long-Context, and Code SearcharXiv cs.CL
- Current Assessment开放检索模型在 149M 参数达到 SOTA,可能降低企业构建检索系统的门槛,减少对闭源 API 的依赖。多语言模型 mDenseOn/mLateOn 的跨语言能力差异提示,后期交互架构更适合多语言场景。Agent Pulse · analysis
论文提出完全开放的检索模型训练流程,重建 6.65 亿英文对比预训练对和 188 万监督微调对,训练出两个 149M 参数模型:DenseOn(单向量密集模型)和 LateOn(ColBERT 式后期交互模型),在 BEIR 上分别取得 56.20 和 57.22 平均 nDCG@10,创该规模新 SOTA。将验证过的英文数据翻译成八种语言,得到 28 亿对跨语言样本,训练出两个 307M 参数多语言模型 mDenseOn 和 mLateOn。研究发现密集模型在翻译语言上表现好但泛化到未见语言时下降,而后期交互模型对未见语言泛化更好。
DenseOn 和 LateOn 在 149M 参数规模达到 BEIR SOTA,表明精心构建的训练数据(6.65 亿对比预训练对 + 188 万监督微调对)可以显著提升小模型检索能力。多语言版本显示密集模型和后期交互模型在跨语言泛化上存在差异:密集模型依赖翻译训练支持,后期交互模型泛化更强。
开放检索模型在 149M 参数达到 SOTA,可能降低企业构建检索系统的门槛,减少对闭源 API 的依赖。多语言模型 mDenseOn/mLateOn 的跨语言能力差异提示,后期交互架构更适合多语言场景。
开放检索模型降低企业构建搜索和 RAG 系统的成本,尤其对多语言应用场景。后期交互模型的跨语言泛化优势可能推动多语言搜索产品的开发,减少对翻译管道的依赖。
后续可验证:1)更大规模参数(如 500M+)的开放检索模型能否进一步缩小与闭源模型的差距;2)后期交互模型在更多未见语言上的泛化边界;3)该训练数据配方是否可复用于其他检索架构。