郭震 AI公众号:郭震AI

实时 AI 消息

Hcompany 开源 NeoMME:单个双向 Transformer 处理图文的多语言多模态编码器

9 月 3 日,Hcompany 团队开源 NeoMME:260M 与 800M 两种规模的多语言多模态编码器,用一个双向 Transformer 同时处理文本与图像,无需独立视觉塔或因果语言模型,权重以 Apache 2.0 发布并原生接入 Transformers。其检索版 NeoMME-Retriever 在 ViDoRe v3 以 260M 参数取得 0.523 nDCG@10,并把每页晚交互索引从约 1.5 MB 压缩到 6 kB,仍保留 95% 以上检索质量。

发布时间
Hcompany 开源 NeoMME:单个双向 Transformer 处理图文的多语言多模态编码器
图源: huggingface.co

9 月 3 日,Hcompany 团队在 Hugging Face 博客正式发布 NeoMME——一个面向多语言、多模态场景的编码器模型家族,包含 260M 与 800M 两种规模。全部模型权重以 Apache 2.0 许可证开源,并从发布首日起获得 Hugging Face Transformers 的原生支持,同时提供了配套模型合集与技术报告。

NeoMME 最特别的地方在于架构选择。它没有沿用近期视觉语言模型常见的“预训练视觉塔 + 投影层 + 因果解码器”组合,而是让一个双向 Transformer 同时处理文本 token 与原始图像块:图像被切成 32×32 的块并经小型 MLP 投影后进入同一编码器,文本则使用因子化 token 嵌入。整个模型从零开始训练,目标函数是掩码离散扩散。

得益于单一计算路径,NeoMME 支持动态图像分辨率,图像按原始宽高比输入,信息密集的文档页会获得更多 token;上下文长度达 16,384 token,足以容纳约两张 4K 图像。模型还集成了分组查询注意力、查询-键归一化、门控注意力、2D 旋转位置编码等现代编码器技术,分词器则是在多语言文本、代码、数学与图像转写语料上从头训练的 131k 词表 BPE。

为了让主干模型得到有意义的落地验证,团队以 ColPali 提出的“页面即图像”方法把 NeoMME 微调成文档检索模型 NeoMME-Retriever。它直接对文档页面截图排序,绕过 PDF 文本抽取所需的全部 OCR 预处理,从而保留版式、图表、表格等纯文本难以承载的视觉线索。

NeoMME-Retriever 采用双头设计:密集头把主干隐状态平均池化成归一化向量,适合配合 ANN 做大规模粗排;晚交互头则把每个 token 或图像块投影成 128 维向量,保留查询词与图像区域之间的局部匹配。一次前向推理同时产出两种表示,用户可按语料规模与基础设施灵活取舍。

检索质量方面,260M 版在 ViDoRe v3 上取得 0.523 的 nDCG@10,是评测中所有严格低于 800M 参数模型里的最高分,与 ColQwen2.5 相差不到 0.002,而参数量约为其十四分之一;800M 版拿到 0.556,逼近同量级的 Vultron Retriever Flash,并以 3.6 倍更少的参数超过 ColPali v1.3。对视觉文档检索来说,这意味着过去依赖大参数生成式视觉语言模型的场景,如今用不到其十四分之一参数量的纯编码器也能逼近顶尖水平。

晚交互索引通常随向量数量线性膨胀,高分辨率文档尤甚。团队用分层 token 池化配合非对称量化压缩存储:在 ViDoRe v3 上,每页索引从约 1.5 MB 降到 39 kB(约 39 倍压缩)时仍能保留超过 99% 的检索质量;更激进的配置可压到每页 6 kB、整体缩小 255 倍,同时保住 95% 以上的基线 nDCG@10。

速度同样可观:在单张 NVIDIA L40S、2048×2048 输入下,260M 版每秒可编码约 51 页文档,接近 ColModernVBERT 的两倍,可明显降低大规模语料建索引的 GPU 时长与成本。模型可直接用于 Sentence Transformers v6 微调,官方还提供了从检索到视觉 RAG 的完整示例与在线 demo。

NeoMME 的看点不只是又一个文档检索模型:它验证了“单一双向 Transformer 原生处理图文”这条路线在小参数规模上的可行性,也把多语言与高分辨率检索的成本门槛往下拉。后续值得关注的是 800M 版在更大语料上的表现、压缩配置如何落地到生产索引,以及这套编码器能否反哺视觉问答等更广的任务。

为什么重要

NeoMME 证明了纯编码器路线在视觉文档检索上的性价比:更小参数、更快编码、更低的索引存储成本,可能加速企业级视觉 RAG 与多语言文档搜索的落地。

微博邮件

NeoMMEMultimodalOpen Source
返回实时消息

附近消息

全部