H Company 发布 NeoMME 260M/800M 单塔多模态编码器,取消视觉塔和因果解码器

H Company 发布 NeoMME 系列多模态编码器,包含 260M 和 800M 两个双向 Transformer 模型,用单一塔处理多语言文本和 32×32 图像块,去掉了独立视觉塔和因果解码器,以离散掩码扩散方式预训练。

如今生产环境中的大多数视觉文档检索器都是”旧物翻新”。ColPali 及其后继模型将生成式视觉语言模型改造为编码器使用。结果模型上仍挂着单独预训练的视觉塔,以及一个永远不会生成任何 token 的因果解码器。对于一项只需要表征(representation)的任务而言,这纯属参数和算力的浪费。

H Company 发布了 NeoMME——一个 260M 和 800M 双向编码器系列,将上述两个组件全部移除。单个 Transformer 在同一套层中处理多语言文本 token 和原始 32×32 RGB 图像块,从随机初始化开始训练。其检索微调版本 NeoMME-Retriever 在 ViDoRe v3 上以 260M 参数达到 0.523 的 nDCG@10。

可以部署吗?

可以。每个检查点都以 Apache 2.0 协议发布,并在 Hugging Face Transformers 中提供发布首日(day-zero)支持。260M 模型在单块 NVIDIA L40S 上每秒可索引 51.3 页,在纯 CPU 主机上编码一条查询仅需 78.3 毫秒。

H Company 发布 NeoMME 260M/800M 单塔多模态编码器,取消视觉塔和因果解码器
图片来源:论文 https://arxiv.org/pdf/2609.01657

单塔双模态

文本通过 ALBERT 风格的分层分解嵌入(factorized embedding)进入模型:一个 256 维的查找表,再投影到模型宽度。图像被切分为不重叠的 32×32 图像块,由从零训练的两层 MLP 完成投影。没有 patch-merging 模块,也没有 SigLIP2 视觉塔。

两个模型均支持 16,384 token 的上下文,足以容纳切块后两张标准的 3,840×2,160 4K UHD 图像。大部分层使用对称滑动窗口注意力;每第六层以及最后一层做全局注意力。模型栈采用分组查询注意力(grouped-query attention)、查询-键归一化、门控注意力、2D 旋转位置编码和 squared-ReLU MLP。精确参数量分别为 262,937,906 和 793,715,032。

分词器是不受空白约束的 BPE,词表大小 131,072,同样从零训练。在 FLORES-200 devtest 的 14 种目标语言上,它比 ModernBERT 少产出 44.4% 的 token。

以掩码扩散去噪方式训练

预训练采用文本上的离散掩码扩散,可选择以可见图像块为条件。纯文本段落的损坏率从 0 到 1 均匀采样;多模态段落的损坏率则从 0.30 到 1 采样,这消除了仅靠语言的捷径,迫使模型真正去”阅读”页面。

跨模态消融探针证实了这一设计有效。在 90% 掩码率下,可见页面块将掩码 token 准确率提升了 38.4 个点(260M 模型)和 40.5 个点(800M 模型)。每次训练运行处理约 5240 亿个打包输入 token,其中约 2900 亿为纯文本,分别使用 16 和 32 块 H100 加速器。

检索结果

NeoMME-Retriever 在共享主干上添加了两个联合训练的头:一个带 Matryoshka 宽度的均值池化稠密头,以及一个将每个 token 和图像块投影到 128 维的后期交互(late-interaction)头。一次前向传播即可同时获得两者。

在 ViDoRe v3 上,260M 模型得分 0.523 nDCG@10,800M 模型得分 0.556。260M 的结果与 3.75B 参数的 ColQwen2.5-v0.2 仅差 0.002,且比最佳的其他 300M 以下模型高出 26.1 个点。800M 模型比同尺寸的 Vultron Retriever Flash 落后 0.9 个点。在 ViDoRe v1 和 v2 上,两个模型分别达到 0.860/0.522 和 0.874/0.559 的 nDCG@5。

文本检索相对较弱。在 BEIR-15 上,后期交互得分分别为 0.4881 和 0.5126,而 149M 参数的 LateOn 为 0.5722。作者将此部分归因于监督规模:NeoMME 大约见过 43 万条文本查询样本,而 mLateOn 大约有 6.6 亿条对比样本。

存储与吞吐

后期交互索引代价高昂。一张 2048×2048 的页面会产生 4,162 个向量,float32 格式下每个 ViDoRe v3 文档约 1.5 MB。两种方法可以降低这一开销:分层 token 池化(因子 10,int8 查询与文档)可将每页降至 39.0 kB,缩减 39.4 倍,同时保留基线 nDCG@10 的 99.16%;池化因子 8 配合 int8 查询与二值化文档,可降至 6.0 kB,缩减 255.5 倍,保留 95.19% 的性能。

就向量数量而言,索引速度很快。在单块 L40S 上、同样输入 2048×2048 的条件下,NeoMME-260M 每秒编码 51.3 页,而 ColModernVBERT 为 26.0 页,差距达 1.97 倍。

关键要点

  • 单个双向 Transformer 同时处理文本和原始图像块,没有视觉塔,也没有解码器。
  • NeoMME-Retriever-260M 在 ViDoRe v3 上取得 0.523 nDCG@10,击败所有 800M 以下的已评估模型。
  • 在 ViDoRe v3 上与 3.75B 参数的 ColQwen2.5 持平,而体积小 14.4 倍。
  • Token 池化加非对称量化将索引从每页约 1.5 MB 压缩到 6 kB。
  • 纯文本检索和冻结自然图像迁移仍是明显的短板。

本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/jishu/71765.html

(0)

相关推荐