首页 > 教程攻略 > ai资讯 >T-Eval:大模型智能体能力评测基准解读 | ACL

T-Eval:大模型智能体能力评测基准解读 | ACL

来源:互联网 时间:2026-08-17 14:24:14

AI Agent(智能体)

作为大模型的重要应用形态,正通过调用外部工具来完成复杂任务、串联多步骤流程。然而,如何系统性地评估模型的工具使用能力,始终是一个难点。最近,司南团队及合作伙伴推出了

T-Eval 评测基准

,相关论文已被ACL 2024主会收录。论文地址见文末引用。

为什么需要 T-Eval?

当大模型学会用工具,解决问题的能力确实让人眼前一亮。但现有的评估方法,大多只关注单步骤任务中模型调用工具的表现——说白了,就是测一测模型能不能正确调用一个函数。可现实中的问题往往是多步骤、环环相扣的,需要模型先规划、再检索、再执行、再检查……这种复杂场景下的工具使用能力,目前评估得远远不够。

正是为了填补这个空白,T-Eval应运而生。它把大模型的工具使用能力拆解成六个精细的子过程,逐项评估,而不是简单地看最终结果。这六个维度分别是:

  • 规划(PLAN)

    :把用户的问题拆解成若干子问题,制定行动路线。
  • 推理(REASON)

    :判断当前执行到哪一步,并思考下一步该做什么。
  • 检索(RETRIEVE)

    :从给定的工具列表中挑选最合适的工具。
  • 理解(UNDERSTAND)

    :准确理解工具的使用文档和参数要求。
  • 指令跟随(INSTRUCT)

    :按指定格式生成工具调用的请求。
  • 审查(REVIEW)

    :评估每一次工具调用的结果,确保最终回答符合预期。

这种细粒度的拆解,让评估不再是“一锤子买卖”,而是能找出模型到底在哪个环节掉链子。

T-Eval 的构建过程

构建一套可靠的评测基准,背后是三个阶段的打磨:

工具收集、指令生成和参考答案标注

首先,团队根据工具的可用性和使用频率,精心挑选了15种基础工具,覆盖研究、旅行、娱乐、网络、生活和金融等多个领域。每个工具都配套生成详细的API文档,尽量排除因工具描述不清而导致的调用失败。

接下来是生成指令。先用GPT-3.5产出初始问题,再让GPT-4把问题打磨得更严谨。随后,开发了一个多智能体框架,让这些智能体在工具集中协作求解,同时记录下完整的求解路径和工具返回结果。最后,由人类专家从中挑选出高质量样本作为基准数据。

T-Eval 的主要贡献

这项工作的意义,可以从三个层面看:

细粒度评测

:不是简单给模型打一个总分,而是把工具使用拆成多个子任务,每个子任务单独打分。这样,模型的强项和短板一目了然。

多智能体数据生成

:引入人类专家对生成流程进行校验,大大减少了外部噪声对评测结果的影响,让结论更稳定、更公平。

广泛的实验验证

:在多种大模型上反复测试,验证了T-Eval的有效性和普适性。这些结果不仅揭示了当前大语言模型在工具使用上的瓶颈,也为后续的改进提供了清晰的方向。

T-Eval 评测结果

团队在T-Eval上测试了20种大语言模型,既有基于API的商业模型,也有开源模型。结果显示,GPT-4在整体评分上拔得头筹,工具使用能力确实强悍。

开源模型方面,分别测试了7B、13B和70B三个规模。规律很明显:模型参数越大,表现越好。其中,Qwen-72B的总得分已经非常接近API商业模型。这或许说明,开源模型在工具使用上的潜力正在快速释放。

T-Eval目前已经集成到OpenCompass评测平台中。如果你想深入了解,可以查阅论文原文或访问官方项目页面。