首页 > 教程攻略 > ai资讯 >腾讯开源Conan-embedding,登顶CMTEB

腾讯开源Conan-embedding,登顶CMTEB

来源:互联网 时间:2026-08-25 14:35:18

腾讯最近开源了一款向量模型,名为Conan-embedding,直接拿下了CMTEB(中文大规模文本嵌入基准)排行榜的第一名。嵌入模型作为RAG和Agent的关键组件,竞争早已白热化——谁能让向量更精准地理解语义,谁就能在检索和生成中占据先机。

这篇论文的标题是《Conan-embedding: General Text Embedding with More and Better Negative Samples》。核心思路很直接:对比学习中负样本的质量和数量至关重要,但以往的做法往往把负样本挖掘当成一个预处理步骤,一旦挖好就固定不动了。Conan-embedding针对这个问题给出了两个新解法——动态硬负样本挖掘和跨GPU批次平衡损失(CBB Loss),同时还发现用LLM生成的提示-响应对也能用来训练嵌入模型,让模型对文本的理解更聪明。

模型已经开源,地址在Hugging Face上(https://huggingface.co/TencentBAC/Conan-embedding-v1),可以直接拿去用。

动态硬负样本挖掘

传统做法是在训练前选好一堆难负例,然后丢进模型里。但问题在于,模型在训练过程中会不断进步,原先那些“难”的负例可能很快就不难了。Conan-embedding的做法是在训练中每100步检查一次:如果某个负例的分数乘上1.15仍然小于初始分数,并且绝对值小于0.8,说明这个负例已经不够困难,那就用新的难负例把它替换掉。这样模型在整个训练过程中都能持续面对有挑战性的样本,效果自然更好。

跨GPU批次平衡损失(CBB Loss)

对比学习有个潜在需求:负样本越多越好。但GPU显存是硬约束,单卡能放的批次大小有限。Conan-embedding的思路是把多个GPU上的负样本“拼”到一起——利用跨GPU通信,让每张卡都能看到其他卡上的样本,从而突破单卡显存的限制。同时,它还通过一种平衡策略来协调不同任务之间的批次大小,避免某些任务因为样本数量悬殊而影响整体训练效果。这个方法简单直接,但非常实用。

除此之外,论文还提到一个有趣的发现:用LLM生成的prompt-response对来训练嵌入模型,可以让模型更好地理解指令和回答之间的关系。这相当于给模型补充了一类天然的高质量正负样本,尤其是在语义匹配任务上效果显著。

在CMTEB的六个任务上,Conan-embedding全面超越了此前所有模型。消融实验也证实了动态硬负样本挖掘和CBB Loss各自都贡献了显著的提升。整体来看,这套方案在工程和算法层面都做得非常扎实,值得关注。