郭震 AI公众号:郭震AI

实时 AI 消息

Sentence Transformers v6.0发布:新增多向量编码器,支持ColBERT式检索

Hugging Face发布博客宣布,Sentence Transformers库v6.0新增第四种模型类型MultiVectorEncoder,支持ColBERT式晚期交互检索,并可直接加载PyLate与ColBERT检查点。多向量模型为每个token保留一个向量、以MaxSim算子打分,检索质量更强但索引更大,同时覆盖无需OCR的视觉文档检索。

发布时间
Sentence Transformers v6.0发布:新增多向量编码器,支持ColBERT式检索
图源: huggingface.co

Hugging Face于8月18日发布博客宣布,Sentence Transformers库迎来v6.0更新,新增第四种模型类型MultiVectorEncoder,用于ColBERT风格的晚期交互检索。

新版本最大的亮点是兼容性:任何PyLate检查点和斯坦福NLP的ColBERT检查点都可以直接加载,用于视觉文档检索的colpali-engine模型也能通过同一套API使用,与dense、sparse和reranker模型的使用体验一致。

与把整段文本压缩成一个向量的普通embedding模型不同,多向量模型为每个token保留一个向量,并用MaxSim算子对查询与文档打分,从而保留token级别的匹配信息,检索质量通常更强,代价是索引更大。

博客还展示了多向量模型在语义搜索、检索再排序、视觉文档检索等场景的用法:视觉文档检索可以直接让文本查询匹配页面图像,无需中间的OCR步骤,这也是该方法的SOTA领域。

Sentence Transformers是开源社区使用最广泛的embedding库之一,v6.0把ColBERT系模型纳入标准API,意味着开发者无需再依赖零散的第三方实现,即可获得晚期交互检索能力。

后续值得关注的是社区迁移速度、索引压缩与推理加速的实践,以及这一能力与RAG应用栈的整合深度。

为什么重要

作为最流行的开源embedding库之一,Sentence Transformers把ColBERT式检索纳入标准API,将显著降低晚期交互检索与视觉文档检索的工程门槛。

微博邮件

Hugging FaceOpen SourceEmbedding
返回AI日报

附近消息

全部