更难、更好、更快、更强:LLM Leaderboard v2 现已发布
来源:互联网
时间:2026-08-13 14:11:15
评估和比较大语言模型(LLMs)从来就不是一件轻松的事。这话可不是随便说说——早在一年前,我们的RLHF团队就亲身体会到了这一点。当时他们想复现并比较几个已发布模型的结果,结果发现这几乎是个不可能完成的任务:论文或营销发布里给出的分数,要么没有配套的可复现代码,要么本身就透着可疑,更多时候只是通过精心优化的提示或评估设置来把模型分数“刷”上去。所以,团队决定自己动手,搭建一个平台:在完全相同的设置下(同样的问题、相同的顺序、一模一样的环境)评估参考模型,收集完全可复现、可比较的结果。于是,Open LLM Leaderboard 就这么诞生了。
自那以后,随着一系列高调模型发布,这个排行榜迅速成为机器学习社区乃至更广泛领域里的热门资源。过去10个月里,它吸引了超过200万独立访问者。每月大约有30万社区成员通过提交和讨论使用这个平台,目的通常很明确:一是寻找最先进的开源发布——排行榜提供了可复现的分数,能区分营销炒作和真正的进展;二是评估自己的工作,无论是预训练还是微调,公开比较方法、对标最优模型,并获得公众认可。
然而,随着排行榜越来越成功,模型性能不断飙升,新的挑战也来了。经过一年多的高频使用和大量社区反馈,我们觉得是时候升级了。于是,Open LLM Leaderboard v2 来了!
(注意:新排行榜还是原来的链接,但内容焕然一新。)
那么,为什么需要一个新的排行榜呢?
### 为什么需要更具挑战性的排行榜
过去一年里,我们使用的基准测试已经被过度使用和饱和,具体表现在三个方面:
1. **对模型来说太容易了**。比如,模型现在在 HellaSwag、MMLU 和 ARC 上已经达到了人类基准性能——这就是所谓的“饱和”现象。
2. **一些较新的模型出现了污染迹象**。这意味着模型可能在基准数据或与基准数据高度相似的数据上进行过训练。结果就是,部分得分不再反映模型的一般性能,反而像是在某些评估数据集上过拟合。尤其是 GSM8K 和 TruthfulQA,已经出现在一些指令微调集中。
3. **部分基准测试本身存在错误**。例如,最近多个研究团队对 MMLU 进行了深入调查,发现了响应中的错误并提出新版本。另一个例子是 GSM8K 使用了特定的生成结束标记(冒号),这导致许多长回复模型的表现被不公平地压低。
所以,我们决定彻底更换 Open LLM Leaderboard v2 的评估体系!
### 重新选择评估标准
我们需要寻找新的基准测试:未污染、高质量的数据集,使用可靠的指标,并且能测量模型的关键能力。
最终,我们决定覆盖以下一般任务:知识测试、短期和长期上下文推理、复杂数学能力,以及跟人类偏好高度相关的任务(比如指令遵循)。具体来说,我们采用六个基准测试:
- **MMLU-Pro**(大规模多任务语言理解 - 专业版):MMLU-Pro 是 MMLU 的改进版。原版 MMLU 一直是多选知识数据集的标杆,但最近的研究表明它既有噪音(有些问题无法回答),又太容易(模型能力进化加上污染增加)。MMLU-Pro 将选项从4个增加到10个,要求模型在更多问题上进行推理,并经过专家审查减少噪音。它更高质量也更有挑战。
- **GPQA**(研究生级别的谷歌问答基准):这是一个极其困难的知识数据集,问题由领域专家(生物学、物理学、化学等博士水平)设计,外行人很难回答,但专家相对容易。问题经过多轮验证,确保难度和准确性。而且数据集只能通过网关机制访问,大大降低了污染风险(这也是为什么我们不在文章中提供纯文本示例——论文作者的要求)。
- **MuSR**(多步软推理):这是一个非常有趣的新数据集,由算法生成的复杂问题组成,每道题长约1000字。问题包括谋杀推理、物体放置优化、团队分配等。模型必须结合推理和长上下文解析才能解决。目前很少有模型得分能超过随机水平。
- **MATH**(数学启发式测试,5级子集):MATH 是高中级别竞赛问题的汇编,用 Latex 统一格式化方程,用 Asymptote 格式化图形。生成的答案必须严格遵循特定输出格式。我们只保留最难的那一级。
- **IFEval**(指令遵循评估):这个数据集测试模型是否能够清晰遵循明确指令,比如“包含关键词 x”或“使用格式 y”。模型被评估的是对格式指令的严格遵循,而不是实际生成内容的优劣,因此可以使用非常严格的指标。
- **BBH**(大基准测试难题):这是 BigBench 数据集中23个具有挑战性任务的子集,选择标准是:使用客观指标、难度高(语言模型未能超越人类基线)、样本足够多以保证统计显著性。这些任务涵盖多步算术和算法推理(布尔表达式、SVG图形理解)、语言理解(讽刺检测、名称消歧)以及一些世界知识。BBH 的表现平均与人类偏好高度相关。我们期望这个数据集能提供对特定能力的有趣洞察。
### 为什么选择这些子集?
总的来说,我们的选择标准是:
1. **评估质量**:数据集经过人工审查(MMLU-Pro、GPQA),或在学术界和开源社区广泛使用(BBH、IFEval、MATH)。
2. **指标可靠性和公平性**:多选评估在模型间通常公平;生成性评估严格限制格式(如MATH),或使用明确指标(如IFEval)、后处理(如BBH)来提取正确答案。
3. **避免污染**:通过网关机制(GPQA)或数据集较新(MuSR、MMLU-Pro)来减少污染风险。
4. **测量社区感兴趣的技能**:与人类偏好相关(BBH、IFEval),或评估特定能力(MATH、MuSR)。
选择新基准只是第一步。我们还对排行榜做了几项其他改进,下面一一介绍。
### 报告更公平的排名平均值:标准化分数
我们改变了最终得分的计算方式。不再简单地把每个基准的得分相加,而是将这些得分标准化在随机基线(0分)和最大可能得分(100分)之间,然后平均所有标准化分数得到最终平均分,并以此排名。举个例子:在一个每道题有两个选择的基准测试中,随机基线会得到50分(满分100)。如果使用随机数生成器,你大约会得到50分。这意味着原始得分始终在50到100之间。我们将范围调整,使原始50分对应标准化0分。对于 IFEval 或 MATH 这类生成性评估,这个调整没有影响。
这个变化比看起来重要得多——它实际上改变了每个基准在最终平均分中的权重。上图中,左侧是标准化得分,右侧是原始得分。如果只看右侧,你会觉得 MATH 5级和 MMLU-Pro 是最难的(原始平均值最低)。但实际上,我们的两个最难的评估是 MATH 5级和 GPQA——博士水平的问题!今天大多数模型在 GPQA 上接近随机性能,因此未标准化得分和标准化得分之间存在巨大差异(随机基线得分为0)。这个变化也影响了整体模型排名。假设有两个很难的评估:一个是生成性评估,另一个是多选题(两个选项)。模型A在生成性评估得0分,在多选题得52分;模型B在生成性评估得10分,在多选题得40分。看原始平均值,模型A平均26分,模型B平均25分,似乎A更好。但对多选题基准来说,他们实际上都同样差:52分几乎是随机分数,40分也是不幸的随机分数。取标准化得分后,A得0分,B得约1分。而在生成性评估中,B比A高出10分!如果取标准化平均值,B得5分,A几乎为0,排名完全不同。
### 更容易的可复现性:更新评估套件
去年,我们选择使用 EleutherAI 的 Harness(lm-eval)进行评估。它提供了标准和稳定的多任务实现。为了确保公平和可复现,我们固定了所使用的版本。这样所有模型都在完全相同设置下(相同硬件、相同评估套件、相同参数)进行比较。
但随着`lm-eval`的更新,某些任务或指标的实现发生了变化,导致人们在新版本上获得的结果与我们固定版本的结果出现差异。对于新版排行榜,我们与 EleutherAI 团队(特别感谢 Hailey Schoelkopf)合作更新了 harness。功能上,增加了对 delta 权重(LoRA 微调/模型适配)的支持、与排行榜兼容的日志系统,以及备受期待的用聊天模板进行评估。任务方面,我们花了数周手动检查所有实现和生成结果,修复了诸如少样本样本不一致、句子结束标记过于严格等问题。我们为排行榜任务创建了特定的配置文件,并正在添加测试套件,以确保评估结果随时间保持不变。
(你可以在这里探索我们使用的可视化工具!)这将使我们能够随时更新版本,将来添加新功能。
### 维护者推荐介绍
过去一年里,我们评估了超过7500个模型,但很多并不是社区广泛使用的。最常用的通常是新基础预训练模型,它们通常用大量计算资源构建,社区可以随后微调以适应自己的用例(比如 Meta 的 Llama3 或阿里巴巴的 Qwen2)。一些高质量的聊天或指令模型,如 Cohere 的 Command + R,也找到了庞大的用户群,成为社区实验的坚实基础。
但其他模型的故事可能不同——即使它们在排行榜上排名靠前。有些模型很实验性,是通过20多个连续创建步骤(微调或合并)组合而成的令人着迷的产物。然而,这些模型也带来挑战:当堆叠这么多步骤时,模型配方的精确历史很容易丢失(父模型可能被删除,先前步骤的微调信息可能消失);模型可能无意中受到污染(去年发生过几次——从包含 TruthfulQA 或 GSM8K 信息的指令数据集微调的父模型派生而来);模型可能在基准测试上表现很好,但与其实际表现无关(选择在相同基准上表现优异的模型进行合并,似乎会选择性提高这些基准上的表现,而实际生活情况中的质量未必提升——这还需要更多研究)。
为了在排行榜中突出高质量模型,并优先评估最有用的模型,我们引入了一个新类别:**维护者推荐** ⭐。在这个列表中,你会看到来自各种来源的 LLM,由社区和 Hugging Face 团队手工挑选。包括 Meta、Google 这样的公司,Cohere、Mistral 这样的初创公司,EleutherAI、NousResearch 这样的集体,以及许多其他用户发布的优秀模型。这个列表将根据社区建议和我们的观察持续更新,力求囊括最新的 SOTA LLM,并优先评估这些模型。希望这也能让非机器学习用户更容易在众多模型中找到方向。
### 投票模型相关性
在上一版排行榜中,评估通常按先提交先评估的队列进行。随着用户有时一次提交多个 LLM 变体,而 Open LLM Leaderboard 运行在 Hugging Face 科学集群的空闲计算资源上,我们决定引入投票系统。社区可以为模型投票,我们将优先运行票数最多的模型,把最受期待的模型排在队列顶部。如果某个模型在集群满负荷时获得极高票数,我们甚至可能手动运行它,而不是其他内部任务。为了避免垃圾投票,用户必须登录 Hugging Face 账户才能投票,我们会保存投票记录。
### 更好和更简单的界面
如果你是常用户,可能已经注意到我们前端从上个月开始变得更快了。这要归功于 Gradio 团队的工作,他们开发了新的数据加载方式,让数据在客户端加载,使得任何列选择或搜索几乎瞬间完成。你也可以在自己的排行榜中重用这个方案!此外,我们将 FAQ 和关于标签移到了独立的文档页面,让主界面更清爽。
## 新排行榜,新结果!
我们已经开始添加和评估“维护者推荐”部分的模型,并期待社区向新版排行榜提交他们的新模型!
### 排名结果如何?
比较旧版排行榜的前10名和新版的结果,有些模型的排名相对稳定(加粗显示):Qwen-2-72B-Instruct、Meta 的 Llama3-70B-Instruct、01-ai 的 Yi-1.5-34B-Chat、Cohere 的 Command R +,以及 AbacusAI 的 Smaug-72B。特别值得一提的是 Qwen2-72B-Instruct,它比其他模型高出一大步,平均得分43.02(尤其在数学、长上下文推理和知识方面表现出色)。第二名 Llama-3-70B-Instruct(平均36.67)在 GPQA 上比其预训练版丢掉了15分(4.92 vs 19.67)!这引发了一个问题:Meta 团队对它进行的广泛指令微调,是否影响了一些专家级/研究生级别的知识?
当然,这只是排行榜的起点,随着更多模型被评估,排名很快就会改变。你可以查看队列状态,看看哪些模型正在运行。
| 排名 | 新排行榜排名 |
|------|--------------|
| ⭐ | **Qwen/Qwen2-72B-Instruct** |
| 2 | **meta-llama/Meta-Llama-3-70B-Instruct** |
| 3 | *microsoft/Phi-3-medium-4k-instruct* |
| 4 | **01-ai/Yi-1.5-34B-Chat** |
| 5 | **CohereForAI/c4ai-command-r-plus** |
| 6 | **abacusai/Smaug-72B-v0.1** |
| 7 | Qwen/Qwen1.5-110B |
| 8 | Qwen/Qwen1.5-110B-Chat |
| 9 | microsoft/Phi-3-small-128k-instruct |
| 10 | 01-ai/Yi-1.5-9B-Chat |
以下是排名变化的细节:
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名