首页 > 教程攻略 > ai资讯 >社区供稿 | RAG 再添新利器!智源开源最强检索排序模型 BGE Re-Ranker v2.0

社区供稿 | RAG 再添新利器!智源开源最强检索排序模型 BGE Re-Ranker v2.0

来源:互联网 时间:2026-07-28 15:08:26

自2023年8月亮相以来,智源研究院的BGE系列模型在AI圈子里一直保持着相当高的热度。截至今天,全球下载量已经突破1500万,稳居国内开源AI模型之首。其中,BGE-M3曾在Hugging Face热门模型排行榜上一度冲进前三,其代码仓库FlagEmbedding也跻身GitHub热门项目前十。更重要的是,BGE-M3带来的通用检索模式,已经被Milvus、Vespa等主流向量数据库原生集成,成为不少团队搭建RAG管线的默认选择。

最近,智源团队又放出了大招:新一代排序模型BGE Re-Ranker v2.0正式发布,同时向量模型BGE也扩展了“文本+图片”混合检索能力。说到底,这次更新到底带来了什么?一件事一件事说清楚。

技术亮点

图1 RAG pipline

在信息检索和RAG pipeline里,排序模型一直是个关键角色。向量模型(比如BGE-M3-Dense)和稀疏检索模型(比如BGE-M3-Sparse)负责第一轮粗筛,从数据库和倒排索引里捞出一堆候选文档。但这批粗粒度的结果往往不够精准,需要排序模型(也就是Re-Ranker)来二次过滤,最终拿到高质量的精排文档集,再喂给大语言模型做增强生成。说白了,向量模型负责海选,排序模型负责决赛。

BGE Re-Ranker v2.0针对这个环节做了几项实实在在的升级:

  1. 模型基座有两种选择

    :一种是基于MiniCPM-2B、Gemma-2B这类轻量大语言模型打造的BGE Re-Ranker v2-LLM(图2A);另一种是基于自家更小的BGE-M3-0.5B打造的BGE Re-Ranker v2-M3(图2B),速度更快。

    图2

  2. 多语言能力全覆盖

    。所有模型都用多语言数据训练过,天生就具备跨语言检索的本事。比如BGE Re-Ranker v2-MiniCPM-2B在中英文任务上优势明显,而v2-Gemma-2B和v2-M3则在多语言榜单上拿下了最佳成绩(具体数据配比可以参考GitHub仓库说明)。

  3. 推理效率的妙招:分层自蒸馏

    。简单说,就是用模型最终层的排序得分(S(0))当老师,通过知识蒸馏让各个中间层也学会排序。这样用户在实际部署时,就可以根据手里的算力和时延要求,灵活选择用多少层来跑推理,性能收益与开销之间可以自由权衡。

  4. 向量模型也能理解图片了

    。BGE-v1.5和BGE-M3通过引入由CLIP模型生成的visual token,获得了文本与图片混合建模的能力。更巧妙的是,visual tokenizer的训练完全不影响原本的BGE模型参数,所以原有的文本检索性能一点都没丢——既能看图,又不丢老本行。

性能评测

BGE Re-Ranker v2.0系列在英文、中文、多语言以及RAG场景下的表现如何?直接看数据。

1. 英文检索

在MTEB/Retrival基准上(表1),BGE Re-Ranker v2对BGE-v1.5-large的top-100候选集做重排。v2-Gemma-2B表现最亮眼,检索精度直接提升了6%。有意思的是,通过分层自蒸馏拿到的中间层结果(比如MiniCPM-28层 vs 40层),精度跟最终层几乎一样,说明轻量部署完全可行。如果切换到更强的向量模型E5-Mistral-7B,平均检索得分(NDCG@10)达到了60.4,比原始的embedding-only结果(56.85)提升了近4%,这也是目前BEIR基准上的最佳表现[1][2]。

表1

2. 中文检索

在C-MTEB/Retrival上(表2),结果跟英文类似。BGE Re-Ranker v2-MiniCPM-2B拿下了最优质量,中间层(layer 28)同样稳稳保持了最终层的精度。

表2

3. 多语言检索

在MIRACL榜单上(表3),BGE Re-Ranker v2对BGE-M3的top-100重排。这次v2-Gemma-2B综合效果最好,但v2-M3只用0.5B的参数量就追上了它。这也反映出不同预训练基座在不同语言上的差异——选模型得看具体场景。

表3

4. RAG评测

在Llama Index提供的RAG基准[3]上(表4),BGE Re-Ranker v2对多种embedding模型(bge v1.5 large、bge-m3、openai-te3、mxbai-embedding)的召回结果重排后,所有场景下的精度都大幅提升。而且,bge-m3搭配BGE Re-Ranker v2能获得端到端的最佳检索质量。

表4

5. “文本+图片”混合检索

最后来看看图文混合检索的表现(表5)。Visualized BGE在WebQA、CIRR、FashionIQ、OVEN-QS、ReMuQ五个基准上,相比CLIP基线优势明显。这也意味着,以后做多模态RAG可以直接用这套模型,不用再单独折腾图片检索管道了。

表5

BGE 社区生态

BGE系列之所以能这么火,除了性能过硬,还因为它的通用性非常强。主流的向量数据库都纷纷跟进集成。比如BGE-M3已经被Vespa、Milvus等框架整合,为社区用户搭建“稠密检索+稀疏检索+重排序”三位一体的检索管线提供了极大的便利。

1. Vespa使用示例(详见[4])

2. Milvus使用示例(详见[5])