首页 > 教程攻略 > ai资讯 >OlympicArena:为超级智能AI基准测试多学科认知推理能力

OlympicArena:为超级智能AI基准测试多学科认知推理能力

来源:互联网 时间:2026-08-23 13:35:10

一、结论写在前面

下面介绍的论文来自上海交通大学和上海AI实验室,标题是《OlympicArena: Benchmarking Multi-discipline Cognitive Reasoning for Superintelligent AI》。

为了让AI的能力测试更贴近真实世界的复杂挑战,论文引入了一个名为OlympicArena的全新基准。你猜怎么着?它包含了1163道双语文本问题,覆盖纯文本和图文混合两种模态,横跨7个学科和62项国际奥林匹克竞赛,并且经过了严格的数据泄露筛查。为什么偏偏选奥林匹克题目?因为这类问题复杂且跨学科,恰好能逼出AI在认知推理上的真功夫——这对于解决高级科学难题和推动发现至关重要。

除了常规的答案正确率评估,论文还从多个角度进行了详细剖析,包括模型在不同模态下的表现,以及在过程级评估中的结果。这对那些需要复杂推理和长篇解答的任务来说,格外重要。广泛评估后的结果令人咋舌:即便是顶级的GPT-4o,整体准确率也仅有39.97%(数学28.67%,物理更是只有29.71%)。这个数字清楚地揭示了当前AI在复杂推理和多模态融合上的短板。

通过OlympicArena,论文的目标很明确:推动AI向“超级智能”迈进,让它们能应对科学及其他领域中更棘手的挑战。论文团队还提供了一套完整的资源来支持相关研究,包括基准数据集、开源标注平台、详细评估工具和一个带自动提交功能的排行榜。

二、论文的简单介绍

2.1 论文的背景

现有的基准测试大多借用了各类考试题来评估大语言模型的问题解决能力,但问题是这些题目更偏重知识记忆,对现在的模型来说难度不够大。而且,这些基准主要集中在纯文本模式。尽管有些新基准开始尝试大学水平的题目并加入多模态,但它们本质上还是围着知识密集型任务或简单的概念应用打转(见表1)——这就像在说“我们会背公式就行”。与这项工作同期进行的还有He等人的研究,他们也引入了奥林匹克级别的基准,不过只局限在数学和物理两个领域。

此外,所有上述基准都缺乏对各种认知推理能力系统而细致的评估。它们基本上都是“看答案打分”,忽略了推理过程中可能出现的各种错误。这就意味着我们需要一个更全面的评估工具:不仅要涵盖更广泛的学科,还得关注更高层次的认知推理以及更精细的评价方式。

正因如此,OlympicArena诞生了。它全面、极具挑战性,并且经过了严格的筛选,还带有颗粒度精细的评价机制,目标就是能在奥林匹克级别的题目中,全面衡量高级AI的能力(如图2所示)。论文团队广泛收集并处理了来自七个学科——数学、物理、化学、生物、地理、天文学和计算机科学——总计62个不同奥林匹克竞赛的题目。经过这一番折腾,最终形成了一个包含1163道题的基准,按答案类型分成了13种(比如表达式、区间等)。更关键的是,OlympicArena引入了过程级评估,严格审查AI模型的逐步推理过程。这种深度追查,能帮助我们分辨在正确答案之下,AI的认知推理水平到底如何,从而找出推理链条中的漏洞,最终提升AI的“硬实力”。该基准是双语的(中英文),以提高其在全球范围内的可用性和适用性。同时,它支持两种模态:纯文本和图文混合,来迎合现代AI系统越来越复杂的任务需求。论文还对一些主流模型做了数据泄露检测实验,来验证基准的可靠性。

在现有顶级的大模型(如GPT-4o)和开源模型(如LLaVa-NeXT)上,论文进行了一系列实验。同时在两种设置(纯文本和图文结合)下评估了GPT-3.5这类语言模型,并从答案级和过程级两个角度做了全面评估。答案级评估融合了基于规则和基于模型的方法(这里用的是GPT-4V)来覆盖更多样的答案类型。过程级评估则是对模型输出的每一步进行打分,这在推理场景中至关重要。此外,论文还对不同类型的认知推理做了细致的分类和分析,从逻辑和视觉两个维度来解释当前AI的能力。

2.2 奥林匹克竞技场基准

2.2.1 概述

OlympicArena是一个奥林匹克级别的跨学科基准,专门用来严格考验大语言模型和多模态大模型的认知推理能力。它同时包含纯文本和图文混合两种模式,并用双语呈现,方便更多人参与研究。基准覆盖了七个核心学科:数学、物理、化学、生物、地理、天文学和计算机科学,共34个专业分支(详细信息见附录A.1,涉及近期基本科学领域的实验)。整个集合包含1163道题,来自62个不同的奥林匹克竞赛,并设定了13种答案类型,从客观题(如选择题、填空题)到主观题(如简答题、编程任务),这使其区别于许多以客观题目为主的基准。OlympicArena的详细统计数据见表2。

此外,为了对模型表现进行细致分析,论文将认知推理细分为8种逻辑推理能力和5种视觉推理能力。这套分类有助于详细评估大模型们能展现出的各种复杂推理技能。论文还专门研究了所有多模态问题,以比较多模态模型与其纯文本版本的表现,进而更准地评估模型处理视觉信息的能力。最后,论文不只看答案,还评估了推理过程的正确性和效率。

2.2.2 数据收集

为确保学科覆盖广泛,论文团队先收集了各个竞赛的公开PDF文档链接,然后用Mathpix工具把这些PDF转成Markdown格式,使其能兼容模型的输入要求。对于计算机科学的编程题,还额外收集了对应的测试用例。整个过程严格遵守版权和相关法律。

2.2.3 数据标注

问题提取与标注。

为了从Markdown版试卷中提取出每道题,论文团队聘请了约30名理工科背景的学生参与,并开发了一个数据标注的用户界面(已发布)。为便于后续研究和过程级评估,还标注了“提供的解决方案”等元信息。为确保数据质量,初步标注后执行了多步验证流程。收集完所有题目后,还基于模型嵌入(embeddings)在每个竞赛内部进行去重,以移除可能重复的题目。为证明OlympicArena更侧重认知推理而非大多数其他基准,论文将所有问题按难度分成了三个级别:知识回忆、概念应用和认知推理,并与相关基准做了对比。这里利用GPT-4V作为标注者来分类不同难度级别的问题。

认知推理能力的标注。

为了进行更细致的分析,论文从逻辑和视觉两个角度对认知推理能力进行了分类。逻辑推理能力包括:演绎推理(DED)、归纳推理(IND)、溯因推理(ABD)、类比推理(ANA)、因果推理(CAE)、批判性思维(CT)、分解推理(DEC)和定量推理(QUA)。视觉推理能力包括:模式识别(PR)、空间推理(SPA)、图表推理(DIA)、符号解释(SYB)和比较可视化(COM)。同样用GPT-4V作为标注者来分类不同的认知能力(定义和提示见附录B.3)。通过这些标注,就能对当前AI的认知推理能力进行更细致的分析。

2.2.4 数据分割

基准包含1163道题,其中548道指定用于模型评估,称为OlympicArena-ot。论文跨学科抽样638道题创建OlympicArena-val,用于超参数调优或小规模测试;这些题带有逐步解决方案,支持过程级评估。剩下的题构成了OlympicArena-test,即官方测试集,答案未公开,用于正式测试。本文的结果都基于完整的基准数据集,包括OlympicArena-ot、OlympicArena-val和OlympicArena-test。

2.3 实验

2.3.1 实验设置

为了全面评估大语言模型和多模态大模型在不同模态下的能力,论文设计了三种不同的实验设置:多模态、图像-标题和仅文本。多模态设置评估的是模型利用视觉信息的能力,通过交错的文本和图像来模拟真实场景。对于无法处理交错输入的模型,则将多张图像合并为一个输入。对于那些需要图像输入的多模态模型,其相应的纯文本版本只处理纯文本问题。图像-标题设置探讨的是图像的文本描述是否能增强模型的问题解决能力:使用InternVL-Chat-V1.5为所有图像生成标题,并用这些标题替代原始图像输入。仅文本设置则作为基线,评估模型在没有视觉信息时的表现。所有实验都采用零样本提示(zero-shot),并针对每种答案类型定制输出格式,以方便答案提取和基于规则的匹配;这也最大程度减少了少样本学习可能带来的偏差。

2.3.2 评估

答案级评估

融合了基于规则和基于模型的方法来覆盖多样化的评估问题。对于有固定答案的题,提取最终答案并根据答案类型进行基于规则的匹配。对于代码生成任务,使用无偏的pass@k指标在所有测试用例上进行测试。对于答案类型为“其他”的问题(如化学方程式书写),采用GPT-4V作为评估者来评价响应,并手动抽样检查其正确性。

过程级评估

则深入到推理步骤的正确性,以确保对模型认知能力进行严格的评估。论文从OlympicArena中抽样了96道带有参考答案的问题,用GPT-4将参考答案和模型生成的答案转化为结构化的逐步格式,再将它们提供给GPT-4V,对每一步的正确性进行0到1的打分。为验证与人类判断的一致性,还获取了一些样本进行人工标注。结果显示,基于模型的评估方法非常准确,注释者间一致性达到83%。

2.3.3 主要结果

表3展示了各模型在OlympicArena上的评估结果,可以观察到以下几点:

(1) 即使是目前最先进的GPT-4o,整体准确率也仅为39.97%,而其他开源模型甚至难以达到20%。这一巨大差距凸显了OlympicArena显著的难度和严格性,也证明它在推动当前AI能力边界方面是有效的。

(2) 与生物、地理等学科相比,数学和物理仍然是两个最具挑战性的学科,这可能是因为它们极度依赖复杂的推理能力。

(3) 计算机编程竞赛也相当困难,一些开源模型甚至一个题都没解出来,说明当前模型在设计有效算法解决复杂问题上的能力还很弱。

2.3.4 细粒度分析

为了对实验结果进行更细致的分析,论文基于不同的模态和推理能力做了进一步评估,并分析了过程级评估的结果。主要发现如下:

模型在不同逻辑和视觉推理能力上展现出不同的表现。

如图3所示,几乎所有模型在不同逻辑推理能力上都有相似的性能趋势:在假设推理和因果推理方面表现出色,能从提供的信息中很好地识别因果关系;相反,在归纳推理和分解推理方面则表现不佳。原因在于奥林匹克级别的题目多样且非常规,需要将复杂问题分解成更小子问题的能力。视觉推理方面,模型在模式识别和比较可视化上表现较好,但在涉及空间和几何推理以及理解抽象符号的任务上遇到困难。完整结果见附录D.1。

大多数多模态模型在利用视觉信息方面仍不够熟练。

如图4a所示,只有少数模型(如GPT-4o和Qwen-VL-Chat)在有图像输入时相比其纯文本版本有显著提升,许多模型并未显示出性能提升,甚至部分模型在接入图像后效果还下降了。可能的原因包括:(1) 当文本和图像同时输入时,多模态模型可能更关注文本,忽视了图像中的信息;(2) 一些多模态模型在基于文本模型训练视觉能力时,可能丧失了一些固有的语言能力(如推理能力);(3) OlympiaArena的问题采用了复杂的文本和图像交织格式,某些模型对此支持不佳,导致处理和理解嵌入在文本中的图像位置信息时遇到困难。

过程级评估结果分析

(完整结果见表14)揭示了如下见解:

(1) 过程级评估与答案级评估之间通常高度一致。当模型产生正确答案时,其推理过程的质量在大多数情况下也更高(见图4b)。

(2) 过程级的准确性通常高于答案级。这意味着即使面对极其复杂的问题,模型也能正确执行部分中间步骤。因此,模型或许有未被充分利用的认知推理潜力,这也为研究人员开拓了新的探索方向。论文也发现,在少数学科中,一些在答案级表现出色的模型却在过程级落后,推测这是因为模型在生成答案时可能忽略了中间步骤的合理性(尽管这些步骤对最终结果不是至关重要)。

(3) 通过对错误步骤位置分布的统计分析(见图4c),发现较高比例的错误发生在后期阶段。这表明随着推理步骤的累积,模型更容易出错,也暗示了其在处理长逻辑链推断方面仍需改进。

错误分析

为了将模型的表现进一步具象化,论文从GPT-4V的回答中抽样了错误案例(每个主题16道,其中8道纯文本、8道多模态),让人类评估者分析并标注原因。如图5所示,推理错误(包括逻辑和视觉)构成了最大的一类,这表明OlympicArena有效地突出了当前模型在认知推理能力上的不足。此外,很大一部分错误来源于知识缺陷,说明当前模型仍缺乏专家级别的领域知识,以及用这些知识辅助推理的能力。另一类错误来自理解偏差,这与模型对上下文的误解以及整合复杂语言结构和多模态信息的困难有关。更多案例见附录F.1。

2.3.5 数据泄露检测的努力

考虑到预训练语料库规模日益扩大,检测潜在的基准泄露至关重要。论文采用了一种新的实例级泄漏检测指标——N-gram预测准确率。该方法为每个实例均匀抽样几个起始点,预测每个起始点的下一段N-gram,并检查所有预测是否正确;如果正确,说明模型可能遇到过该实例。论文将此指标应用于所有可用的基础模型或纯文本聊天模型。如图6所示,虽然数量微不足道,但确实发现一些基础模型或纯文本聊天模型遇到过少数基准实例。例如,Qwen1.5-32B-Chat的基础模型就被发现遇到过这些实例。