OlympicArena:为超级智能AI基准测试多学科认知推理能力
一、结论写在前面
下面介绍的论文来自上海交通大学和上海AI实验室,标题是《OlympicArena: Benchmarking Multi-discipline Cognitive Reasoning for Superintelligent AI》。
为了让AI的能力测试更贴近真实世界的复杂挑战,论文引入了一个名为OlympicArena的全新基准。你猜怎么着?它包含了1163道双语文本问题,覆盖纯文本和图文混合两种模态,横跨7个学科和62项国际奥林匹克竞赛,并且经过了严格的数据泄露筛查。为什么偏偏选奥林匹克题目?因为这类问题复杂且跨学科,恰好能逼出AI在认知推理上的真功夫——这对于解决高级科学难题和推动发现至关重要。
除了常规的答案正确率评估,论文还从多个角度进行了详细剖析,包括模型在不同模态下的表现,以及在过程级评估中的结果。这对那些需要复杂推理和长篇解答的任务来说,格外重要。广泛评估后的结果令人咋舌:即便是顶级的GPT-4o,整体准确率也仅有39.97%(数学28.67%,物理更是只有29.71%)。这个数字清楚地揭示了当前AI在复杂推理和多模态融合上的短板。
通过OlympicArena,论文的目标很明确:推动AI向“超级智能”迈进,让它们能应对科学及其他领域中更棘手的挑战。论文团队还提供了一套完整的资源来支持相关研究,包括基准数据集、开源标注平台、详细评估工具和一个带自动提交功能的排行榜。
二、论文的简单介绍
2.1 论文的背景
现有的基准测试大多借用了各类考试题来评估大语言模型的问题解决能力,但问题是这些题目更偏重知识记忆,对现在的模型来说难度不够大。而且,这些基准主要集中在纯文本模式。尽管有些新基准开始尝试大学水平的题目并加入多模态,但它们本质上还是围着知识密集型任务或简单的概念应用打转(见表1)——这就像在说“我们会背公式就行”。与这项工作同期进行的还有He等人的研究,他们也引入了奥林匹克级别的基准,不过只局限在数学和物理两个领域。
此外,所有上述基准都缺乏对各种认知推理能力系统而细致的评估。它们基本上都是“看答案打分”,忽略了推理过程中可能出现的各种错误。这就意味着我们需要一个更全面的评估工具:不仅要涵盖更广泛的学科,还得关注更高层次的认知推理以及更精细的评价方式。
正因如此,OlympicArena诞生了。它全面、极具挑战性,并且经过了严格的筛选,还带有颗粒度精细的评价机制,目标就是能在奥林匹克级别的题目中,全面衡量高级AI的能力(如图2所示)。论文团队广泛收集并处理了来自七个学科——数学、物理、化学、生物、地理、天文学和计算机科学——总计62个不同奥林匹克竞赛的题目。经过这一番折腾,最终形成了一个包含1163道题的基准,按答案类型分成了13种(比如表达式、区间等)。更关键的是,OlympicArena引入了过程级评估,严格审查AI模型的逐步推理过程。这种深度追查,能帮助我们分辨在正确答案之下,AI的认知推理水平到底如何,从而找出推理链条中的漏洞,最终提升AI的“硬实力”。该基准是双语的(中英文),以提高其在全球范围内的可用性和适用性。同时,它支持两种模态:纯文本和图文混合,来迎合现代AI系统越来越复杂的任务需求。论文还对一些主流模型做了数据泄露检测实验,来验证基准的可靠性。
在现有顶级的大模型(如GPT-4o)和开源模型(如LLaVa-NeXT)上,论文进行了一系列实验。同时在两种设置(纯文本和图文结合)下评估了GPT-3.5这类语言模型,并从答案级和过程级两个角度做了全面评估。答案级评估融合了基于规则和基于模型的方法(这里用的是GPT-4V)来覆盖更多样的答案类型。过程级评估则是对模型输出的每一步进行打分,这在推理场景中至关重要。此外,论文还对不同类型的认知推理做了细致的分类和分析,从逻辑和视觉两个维度来解释当前AI的能力。
2.2 奥林匹克竞技场基准
2.2.1 概述
OlympicArena是一个奥林匹克级别的跨学科基准,专门用来严格考验大语言模型和多模态大模型的认知推理能力。它同时包含纯文本和图文混合两种模式,并用双语呈现,方便更多人参与研究。基准覆盖了七个核心学科:数学、物理、化学、生物、地理、天文学和计算机科学,共34个专业分支(详细信息见附录A.1,涉及近期基本科学领域的实验)。整个集合包含1163道题,来自62个不同的奥林匹克竞赛,并设定了13种答案类型,从客观题(如选择题、填空题)到主观题(如简答题、编程任务),这使其区别于许多以客观题目为主的基准。OlympicArena的详细统计数据见表2。
此外,为了对模型表现进行细致分析,论文将认知推理细分为8种逻辑推理能力和5种视觉推理能力。这套分类有助于详细评估大模型们能展现出的各种复杂推理技能。论文还专门研究了所有多模态问题,以比较多模态模型与其纯文本版本的表现,进而更准地评估模型处理视觉信息的能力。最后,论文不只看答案,还评估了推理过程的正确性和效率。
2.2.2 数据收集
为确保学科覆盖广泛,论文团队先收集了各个竞赛的公开PDF文档链接,然后用Mathpix工具把这些PDF转成Markdown格式,使其能兼容模型的输入要求。对于计算机科学的编程题,还额外收集了对应的测试用例。整个过程严格遵守版权和相关法律。
2.2.3 数据标注
问题提取与标注。
认知推理能力的标注。
2.2.4 数据分割
基准包含1163道题,其中548道指定用于模型评估,称为OlympicArena-ot。论文跨学科抽样638道题创建OlympicArena-val,用于超参数调优或小规模测试;这些题带有逐步解决方案,支持过程级评估。剩下的题构成了OlympicArena-test,即官方测试集,答案未公开,用于正式测试。本文的结果都基于完整的基准数据集,包括OlympicArena-ot、OlympicArena-val和OlympicArena-test。
2.3 实验
2.3.1 实验设置
为了全面评估大语言模型和多模态大模型在不同模态下的能力,论文设计了三种不同的实验设置:多模态、图像-标题和仅文本。多模态设置评估的是模型利用视觉信息的能力,通过交错的文本和图像来模拟真实场景。对于无法处理交错输入的模型,则将多张图像合并为一个输入。对于那些需要图像输入的多模态模型,其相应的纯文本版本只处理纯文本问题。图像-标题设置探讨的是图像的文本描述是否能增强模型的问题解决能力:使用InternVL-Chat-V1.5为所有图像生成标题,并用这些标题替代原始图像输入。仅文本设置则作为基线,评估模型在没有视觉信息时的表现。所有实验都采用零样本提示(zero-shot),并针对每种答案类型定制输出格式,以方便答案提取和基于规则的匹配;这也最大程度减少了少样本学习可能带来的偏差。
2.3.2 评估
答案级评估
过程级评估
2.3.3 主要结果
表3展示了各模型在OlympicArena上的评估结果,可以观察到以下几点:
(1) 即使是目前最先进的GPT-4o,整体准确率也仅为39.97%,而其他开源模型甚至难以达到20%。这一巨大差距凸显了OlympicArena显著的难度和严格性,也证明它在推动当前AI能力边界方面是有效的。
(2) 与生物、地理等学科相比,数学和物理仍然是两个最具挑战性的学科,这可能是因为它们极度依赖复杂的推理能力。
(3) 计算机编程竞赛也相当困难,一些开源模型甚至一个题都没解出来,说明当前模型在设计有效算法解决复杂问题上的能力还很弱。
2.3.4 细粒度分析
为了对实验结果进行更细致的分析,论文基于不同的模态和推理能力做了进一步评估,并分析了过程级评估的结果。主要发现如下:
模型在不同逻辑和视觉推理能力上展现出不同的表现。
大多数多模态模型在利用视觉信息方面仍不够熟练。
过程级评估结果分析
(1) 过程级评估与答案级评估之间通常高度一致。当模型产生正确答案时,其推理过程的质量在大多数情况下也更高(见图4b)。
(2) 过程级的准确性通常高于答案级。这意味着即使面对极其复杂的问题,模型也能正确执行部分中间步骤。因此,模型或许有未被充分利用的认知推理潜力,这也为研究人员开拓了新的探索方向。论文也发现,在少数学科中,一些在答案级表现出色的模型却在过程级落后,推测这是因为模型在生成答案时可能忽略了中间步骤的合理性(尽管这些步骤对最终结果不是至关重要)。
(3) 通过对错误步骤位置分布的统计分析(见图4c),发现较高比例的错误发生在后期阶段。这表明随着推理步骤的累积,模型更容易出错,也暗示了其在处理长逻辑链推断方面仍需改进。
错误分析
2.3.5 数据泄露检测的努力
考虑到预训练语料库规模日益扩大,检测潜在的基准泄露至关重要。论文采用了一种新的实例级泄漏检测指标——N-gram预测准确率。该方法为每个实例均匀抽样几个起始点,预测每个起始点的下一段N-gram,并检查所有预测是否正确;如果正确,说明模型可能遇到过该实例。论文将此指标应用于所有可用的基础模型或纯文本聊天模型。如图6所示,虽然数量微不足道,但确实发现一些基础模型或纯文本聊天模型遇到过少数基准实例。例如,Qwen1.5-32B-Chat的基础模型就被发现遇到过这些实例。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名