T-Eval:大模型智能体能力评测基准解读 | ACL
来源:互联网
时间:2026-08-17 14:24:14
AI Agent(智能体)
T-Eval 评测基准
为什么需要 T-Eval?
当大模型学会用工具,解决问题的能力确实让人眼前一亮。但现有的评估方法,大多只关注单步骤任务中模型调用工具的表现——说白了,就是测一测模型能不能正确调用一个函数。可现实中的问题往往是多步骤、环环相扣的,需要模型先规划、再检索、再执行、再检查……这种复杂场景下的工具使用能力,目前评估得远远不够。
正是为了填补这个空白,T-Eval应运而生。它把大模型的工具使用能力拆解成六个精细的子过程,逐项评估,而不是简单地看最终结果。这六个维度分别是:

- :把用户的问题拆解成若干子问题,制定行动路线。
规划(PLAN)
- :判断当前执行到哪一步,并思考下一步该做什么。
推理(REASON)
- :从给定的工具列表中挑选最合适的工具。
检索(RETRIEVE)
- :准确理解工具的使用文档和参数要求。
理解(UNDERSTAND)
- :按指定格式生成工具调用的请求。
指令跟随(INSTRUCT)
- :评估每一次工具调用的结果,确保最终回答符合预期。
审查(REVIEW)
这种细粒度的拆解,让评估不再是“一锤子买卖”,而是能找出模型到底在哪个环节掉链子。
T-Eval 的构建过程
构建一套可靠的评测基准,背后是三个阶段的打磨:
工具收集、指令生成和参考答案标注
首先,团队根据工具的可用性和使用频率,精心挑选了15种基础工具,覆盖研究、旅行、娱乐、网络、生活和金融等多个领域。每个工具都配套生成详细的API文档,尽量排除因工具描述不清而导致的调用失败。
接下来是生成指令。先用GPT-3.5产出初始问题,再让GPT-4把问题打磨得更严谨。随后,开发了一个多智能体框架,让这些智能体在工具集中协作求解,同时记录下完整的求解路径和工具返回结果。最后,由人类专家从中挑选出高质量样本作为基准数据。

T-Eval 的主要贡献
这项工作的意义,可以从三个层面看:
细粒度评测
多智能体数据生成
广泛的实验验证
T-Eval 评测结果
团队在T-Eval上测试了20种大语言模型,既有基于API的商业模型,也有开源模型。结果显示,GPT-4在整体评分上拔得头筹,工具使用能力确实强悍。
开源模型方面,分别测试了7B、13B和70B三个规模。规律很明显:模型参数越大,表现越好。其中,Qwen-72B的总得分已经非常接近API商业模型。这或许说明,开源模型在工具使用上的潜力正在快速释放。

T-Eval目前已经集成到OpenCompass评测平台中。如果你想深入了解,可以查阅论文原文或访问官方项目页面。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名