AI 模型与平台

H 公司发布 NeoMME 开源多模态编码器系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

H 公司研究人员于 2026 年 9 月 3 日发布了 NeoMME,这是一系列拥有 260M 与 800M 参数的多模态、多语言编码器,采用从零训练并在 Apache 2.0 许可证下发布。团队报告称,经过微调的检索变体位于 ViDoRe v3 视觉文档检索基准的模型规模帕累托前沿。

根据发布帖子,许多近期的视觉文档检索器都是基于预训练的生成式视觉语言模型进行改造的,其中单独预训练的视觉编码器生成视觉特征,再由投影器映射到因果语言模型的输入空间。作者写道,检索、分类和标记并不以自回归方式生成文本,因此这些任务不需要因果解码器及其参数和计算开销。NeoMME 则将文本标记和原始图像块一起通过共享的双向 Transformer 处理,且并未基于任何已有的预训练视觉塔、文本编码器或文本解码器。

该帖子将该设计与之前的两项编码器工作进行对比:ModernBERT——提升了双向文本编码器的效率;以及 ModernVBERT——在视觉文档检索中使用 ModernBERT 风格的文本编码器,同时保留了单独的预训练 SigLIP2 视觉塔。作者写道,他们希望消除将视觉语言模型组件引入编码器所带来的开销。

架构与从零预训练

两种 NeoMME 规模采用相同的架构。文本输入使用因式分解的标记嵌入,而图像则被划分为不重叠的 32×32 补丁网格,并通过小型多层感知机进行投影;随后两者共同进入同一 Transformer 编码器。图像保持原始宽高比和尺寸,使模型能够在高分辨率、信息密集的文档页上使用更多标记,而不是在较小的图像上。上下文长度为 16,384 标记,足以容纳最多两张标准的 3840×2160 4K UHD 图像。大多数层使用对称滑动窗口注意力,而每第六层和最终层使用全局注意力。该堆栈还包括分组查询注意力、查询‑键归一化、门控注意力、二维旋转位置嵌入以及平方 ReLU MLP。针对文本,团队从零在多语言文本、代码、数学以及机器生成的图像转录上训练了一个词汇量为 131,072 的 BPE 分词器。

NeoMME 从零进行预训练,作为离散的掩码扩散文本去噪器。对于仅文本示例,腐败率在 0 到 1 之间均匀采样,每个符合条件的文本标记以该率独立被掩码。多模态示例使用 0.3 到 1 之间的腐败率,图像补丁保持可见,模型则重建被掩码的文本;作者写道,强掩码迫使模型学习基于图像的描述,而不是依赖仅语言的捷径。预训练混合了多语言文本、代码、数学、自然图像和文档图像,每个模型处理约 5240 亿个打包输入标记,其中包括 2900 亿来自仅文本示例的标记。作者指出,相较于 ModernBERT 的 2 万亿训练标记,这一文本预算相对较小,并说明他们选择 NorMuon 优化器以提升数据效率。

检索微调与基准结果

为了在下游任务上评估主干模型,团队使用 ColPali 提出的页面‑图像方法对其进行视觉文档检索的微调。NeoMME‑Retriever 并非检索提取的文本块,而是对文档页面的截图进行排序,绕过 OCR 预处理并保留布局、图表、表格和排版。检索器在主干上添加了两个联合训练的头部:一个密集头将隐藏状态进行均值池化得到归一化向量,另一个后期交互头将每个文本标记或图像补丁投射为 128 维归一化向量,保持查询标记与图像区域之间的细粒度匹配。一次前向传播即可返回两种表示。作者总体上推荐使用后期交互嵌入,并在极大语料库中采用密集检索后接后期交互重排的流水线。

在 ViDoRe v3 基准上,帖子报告 NeoMME‑Retriever‑260M 的 nDCG@10 为 0.523,是所有评估模型中参数低于 800M 且成绩最高的,并且仅比 ColQwen2.5 低 0.002,却使用约 14 倍更少的参数。NeoMME‑Retriever‑800M 达到 0.556,距同等规模的 Vultron Retriever Flash 仅差 0.009,两者均位于该基准的模型规模帕累托前沿。帖子中的比较表将竞争者分数标注为来源于 MTEB,而 NeoMME 的分数为团队自行评估。对于较早的 ViDoRe v1 与 v2 基准(使用 nDCG@5),帖子指出 260M 模型优于 ColModernVBERT 以及规模是其两倍的 ColSmol‑500M,而 800M 模型在参数仅为其 3.6 倍的情况下超越了 ColPali v1.3。

NeoMME-260M-Retriever 的模型卡列出了 263M 参数、隐藏层大小为 1,024、BF16 权重,以及 1,024 维密集嵌入,Matryoshka 截断点分别为 128、256、512 和 1,024 维,并提供 128 维多向量输出。该卡片还报告了在 BEIR-15 上的文本检索结果,其中 260M 检索器在后期交互下的 nDCG@10 为 0.4881,800M 模型为 0.5126。

压缩、索引吞吐量与可用性

由于后期交互存储随嵌入向量数量线性增长,高分辨率页面的索引成本很高:一页 2048×2048 的页面在 NeoMME‑Retriever 中会产生 4,200 个向量,约为 2.1 MB(float32),帖子报告在 ViDoRe v3 上每篇文档的实际平均约为 1.5 MB。团队结合了层次化标记池化(将相似文档向量聚类并存储每个簇的均值)和非对称量化(将文档嵌入以 int8 或二进制精度存储,同时保持即时查询嵌入的更高精度)。在 ViDoRe v3 上,帖子称池化因子为 10、查询和文档均使用 int8 时,存储降至每页 39 kB,降低 39 倍,同时保留了超过 99% 的基线 nDCG@10。更激进的设置——池化因子 8、查询使用 int8、文档使用二进制——每页仅需 6 kB,缩小 255 倍,且仍保留超过 95% 的检索质量。

团队还使用预处理的图像张量测量了编码吞吐量,并为每种模型和图像尺寸分别校准批量大小。在单个 NVIDIA L40S GPU 上,使用相同的 2048×2048 输入时,NeoMME‑Retriever‑260M 的编码速度约为每秒 51 页,几乎是 ColModernVBERT 的 26 页的两倍,帖子还报告称,两种 NeoMME‑Retriever 在较小输入分辨率下均快于其他对比模型。

所有 NeoMME 检查点均在 Apache 2.0 许可证下发布,并在 Hugging Face Transformers 中提供了零日实现,同时在 Hugging Face Space 上提供了视觉检索增强生成演示。用于微调时,团队提供了兼容 Sentence Transformers v6 的独立密集和后期交互检查点,后者目前每个模型仅支持一个检索头;若要同时训练两个头,需要使用带自定义 Trainer 的 NeoMMEForRetrieval 类。

随附的技术报告由 Aurélien Lac 与 Tony Wu 撰写,于 2026 年 8 月 31 日提交至 arXiv 的信息检索类别。帖子致谢中,作者将 NeoMME 描述为在有限时间和算力下完成的副项目,并感谢 H 公司对该工作的支持以及提供用于训练的算力。

Jonas Reeve 是 Unite.AI 的 AI 生成分析师,专注于认知 AI、人工通用智能(AGI)和机器智能的理论基础。他的工作探索了学习、推理、记忆和抽象如何在生物和人工系统中出现,建立了现代 AI 架构和认知科学、心灵哲学长期存在的问题之间的联系。
以概念和反思的方法,Jonas 检视了推理模型、代理系统、涌现认知和对齐理论等框架,旨在阐明 AGI 进展的真正含义——以及它的不意味着什么。与其追逐时间表或炒作,他强调了第一原则、概念严谨性和当前模型的局限性。
Jonas Reeve 撰写的文章由 AI 生成并由 Unite.AI 的编辑团队审查,以确保高级 AI 概念的准确性、清晰性和负责讨论。