AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Aug 31, 2026 · NeoMME

NeoMME: A Single-Tower Multimodal-Native Multilingual Foundation Encoder for Efficient Fine-Tuning and Inference

What Happened

NeoMME 是一个 260M 和 800M 参数的多模态多语言双向编码器家族,从零开始预训练,使用掩码离散扩散文本目标,支持 16,384 token 上下文。在 ViDoRe v3 基准上,NeoMME-Retriever 260M 达到 0.523 nDCG@10,800M 达到 0.556。

EVENT STORY

Development

  1. First ReportNeoMME: A Single-Tower Multimodal-Native Multilingual Foundation Encoder for Efficient Fine-Tuning and InferenceHugging Face Daily Papers
  2. Industry Response*NeoMME*: an efficient Multimodal-native and Multilingual EncoderHugging Face
  3. Current AssessmentNeoMME 的出现表明多模态检索正从生成式 VLM 转向专用编码器,以降低推理成本。其性能与参数规模的关系可能影响未来检索系统的设计选择。Agent Pulse · analysis
What Changed

NeoMME 是一个单塔多模态原生多语言基础编码器家族,包含 260M 和 800M 参数版本。与通常基于生成式视觉语言模型(如 ColPali)的检索器不同,NeoMME 使用双向 Transformer 编码器直接处理多语言文本和原始图像块,避免了 VLM 的参数和计算开销。模型从零开始预训练,使用掩码离散扩散文本目标,并支持 16,384 token 上下文,足以编码两张 4K UHD 图像。在 ViDoRe v3 基准上,NeoMME-Retriever 260M 以 0.523 nDCG@10 优于所有 800M 参数以下的模型,800M 版本达到 0.556。

How the Capability Boundary Shifted

NeoMME 采用单塔双向编码器架构,直接处理文本和图像,避免了生成式 VLM 的冗余。其预训练目标为掩码离散扩散,可能提升多模态表示学习效率。支持 16K 上下文,可编码多页文档。在 ViDoRe v3 上,260M 模型超越同规模检索器,表明高效编码器在文档检索任务中具有竞争力。

Why It Matters

NeoMME 的出现表明多模态检索正从生成式 VLM 转向专用编码器,以降低推理成本。其性能与参数规模的关系可能影响未来检索系统的设计选择。

Who It Affects

NeoMME 的高效编码器可降低文档检索系统的推理成本,提升吞吐量,对提供搜索或 RAG 服务的公司具有商业价值。

What to Watch Next

后续可关注 NeoMME 在更大规模参数或更长上下文上的扩展,以及其在其他多模态任务(如视觉问答)上的表现。