UEmbed: Unified Sparse and Dense Multimodal Embeddings
UEmbed 是一个 decoder-only 多模态嵌入模型,在单次因果前向传播中同时生成稀疏词级和稠密表示。它向输入追加 N 个可学习特殊 token,将词汇表划分为 N 个不相交子集,每个 token 的因果隐藏状态预测其分配子集上的稀疏权重,N 个子集拼接成完整稀疏向量。模型在公开数据上训练,发布了 2B、4B 和 9B 三个规模。UEmbed-9B 在 MMEB-v2 上达到稠密 71.8 和稀疏 71.0,优于在公开数据上训练的多模态嵌入模型(如 RzenEmbed)。在 BEIR 上,UEmbed 与强稠密和稀疏基线保持竞争力。
Development
- First ReportUEmbed: Unified Sparse and Dense Multimodal EmbeddingsarXiv cs.CL
- Current AssessmentUEmbed 展示了 decoder-only 模型在嵌入任务上的潜力,可能推动检索系统从 encoder 架构向 decoder 架构迁移。其统一稀疏和稠密表示的能力,可能简化多模态检索系统的构建,减少对辅助模块的依赖。这或影响检索增强生成(RAG)和多模态搜索的产品设计。可验证的信号是:是否有主流检索系统或 RAG 框架集成 UEmbed,以及其在实际场景中的性能表现。Agent Pulse · analysis
UEmbed 是一种新的 decoder-only 多模态嵌入模型,旨在统一稀疏和稠密表示。传统稀疏检索依赖精确词匹配,而 Learned Sparse Retrieval (LSR) 引入了语义能力,但受限于 encoder 架构,且多模态扩展依赖辅助跨模态模块。UEmbed 通过追加 N 个可学习特殊 token 并将词汇表划分为 N 个不相交子集,在单次因果前向传播中同时生成稀疏和稠密表示。模型在公开数据上训练,发布了 2B、4B 和 9B 规模。UEmbed-9B 在 MMEB-v2 上达到稠密 71.8 和稀疏 71.0,优于公开数据训练的多模态嵌入模型(如 RzenEmbed),并在 BEIR 上与强基线保持竞争力。
UEmbed 的关键创新在于将稀疏检索从 encoder 架构扩展到 decoder-only 架构,通过可学习特殊 token 和词汇表分区实现单次前向传播中的统一稀疏和稠密表示。这避免了辅助跨模态模块的依赖,简化了多模态嵌入的生成流程。其性能在 MMEB-v2 上超越公开数据训练的模型,表明 decoder-only 架构在嵌入任务上的可行性。下一步可验证的信号是:UEmbed 是否在更大规模或更多模态数据上保持优势,以及其稀疏表示在真实检索系统中的效率。
UEmbed 展示了 decoder-only 模型在嵌入任务上的潜力,可能推动检索系统从 encoder 架构向 decoder 架构迁移。其统一稀疏和稠密表示的能力,可能简化多模态检索系统的构建,减少对辅助模块的依赖。这或影响检索增强生成(RAG)和多模态搜索的产品设计。可验证的信号是:是否有主流检索系统或 RAG 框架集成 UEmbed,以及其在实际场景中的性能表现。
UEmbed 提供了一种统一稀疏和稠密多模态嵌入的解决方案,可能降低多模态检索系统的开发复杂度,减少对辅助模块的依赖。对于构建搜索、RAG 或多模态应用的团队,这可能带来更高效的模型和更低的部署成本。其开源发布(2B、4B、9B)为不同规模需求提供了选择,可能加速产品落地。可验证的信号是:是否有商业产品采用 UEmbed,或其在检索任务上的实际收益。
UEmbed 的发布可能加速 decoder-only 嵌入模型的研究和应用。未来可关注其在不同模态和任务上的泛化能力,以及是否成为多模态检索的新基线。随着规模增大,其性能可能进一步提升,但需验证在更大规模下的效率和成本。可验证的信号是:后续研究是否基于 UEmbed 进行改进,或其在工业界的采用情况。