AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年8月31日 · NeoMME

NeoMME: A Single-Tower Multimodal-Native Multilingual Foundation Encoder for Efficient Fine-Tuning and Inference

发生了什么

NeoMME 是一个 260M 和 800M 参数的多模态多语言双向编码器家族,从零开始预训练,使用掩码离散扩散文本目标,支持 16,384 token 上下文。在 ViDoRe v3 基准上,NeoMME-Retriever 260M 达到 0.523 nDCG@10,800M 达到 0.556。

EVENT STORY

发展脉络

  1. 首次出现NeoMME: A Single-Tower Multimodal-Native Multilingual Foundation Encoder for Efficient Fine-Tuning and InferenceHugging Face Daily Papers
  2. 行业反馈*NeoMME*: an efficient Multimodal-native and Multilingual EncoderHugging Face
  3. 当前判断NeoMME 的出现表明多模态检索正从生成式 VLM 转向专用编码器,以降低推理成本。其性能与参数规模的关系可能影响未来检索系统的设计选择。Agent Pulse · 分析
改变了什么

NeoMME 是一个单塔多模态原生多语言基础编码器家族,包含 260M 和 800M 参数版本。与通常基于生成式视觉语言模型(如 ColPali)的检索器不同,NeoMME 使用双向 Transformer 编码器直接处理多语言文本和原始图像块,避免了 VLM 的参数和计算开销。模型从零开始预训练,使用掩码离散扩散文本目标,并支持 16,384 token 上下文,足以编码两张 4K UHD 图像。在 ViDoRe v3 基准上,NeoMME-Retriever 260M 以 0.523 nDCG@10 优于所有 800M 参数以下的模型,800M 版本达到 0.556。

能力边界怎么变了

NeoMME 采用单塔双向编码器架构,直接处理文本和图像,避免了生成式 VLM 的冗余。其预训练目标为掩码离散扩散,可能提升多模态表示学习效率。支持 16K 上下文,可编码多页文档。在 ViDoRe v3 上,260M 模型超越同规模检索器,表明高效编码器在文档检索任务中具有竞争力。

为什么重要

NeoMME 的出现表明多模态检索正从生成式 VLM 转向专用编码器,以降低推理成本。其性能与参数规模的关系可能影响未来检索系统的设计选择。

对谁有影响

NeoMME 的高效编码器可降低文档检索系统的推理成本,提升吞吐量,对提供搜索或 RAG 服务的公司具有商业价值。

接下来观察

后续可关注 NeoMME 在更大规模参数或更长上下文上的扩展,以及其在其他多模态任务(如视觉问答)上的表现。