Agent评估探讨
AI Agent评估的现状与方法
自从OpenAI发布了ChatGPT,整个科技圈就像是打开了潘多拉的魔盒——围绕大语言模型(LLM)的研究热潮席卷全球。这股浪潮远不止于模型本身的训练、推理、微调和评估,还延伸到了应用开发框架、应用形态,以及最前沿的AI Agent(无论是单Agent还是多Agent体系)。从最早的ChatBot,到后来的Copilot,再到当下备受瞩目的Agent,大模型的应用形态经历了清晰的演变轨迹,智能化和自主完成任务的能力在逐级攀升。如今,无论是工业界还是学术界,关于AI Agent的研究已经相当丰富,相关框架和平台也层出不穷。
需要先澄清一点:Agent和AI Agent并非大模型时代的新发明,它们是经典的概念。但本文探讨的核心,是特指基于LLM的Agent。关于其定义,最具代表性的当属OpenAI应用研究主管Lilian Weng(翁莉莲)那篇广为流传的万字总结:Agent = LLM + 记忆 + 规划 + 工具。围绕这个定义,业界涌现出一大批开发框架,比如大家熟知的OpenAI GPTs、Agents、Camel、AutoGen、LangGraph、CrewAI,以及MetaGPT、agentUniverse等等。

在实际落地中,开发者不仅需要关心如何快速搭建一个Agent应用,更要衡量这个系统的实际效果。这就引出了一个关键问题——如何评估Agent。这篇文章将围绕这一核心展开:先聊聊评估Agent为什么重要,以及它面临的挑战;然后梳理业界主流的评估方法;最后,给出一些发展趋势上的思考。
1. Agent评估的意义和挑战
Agent和LLM有本质上的区别。Agent可以用来解决更复杂、更贴近现实的任务,这些任务往往没有唯一的标准答案——比如让Agent通过命令行执行任务,或者让一个软件开发Agent操纵自己的计算机界面。相比单次LLM调用,Agent调用的成本高得多。这些差异决定了Agent评估与LLM评估不能直接画等号。结合网上的实践和论文研究,我们可以总结出评估对Agent的几层重要意义:
- 无论是Agent开发者还是平台提供方,Agent处理实际问题的效果都是第一位的。评估不仅能为新开发的Agent品质把关,还能在后续迭代修改时确保不掉链子。
保证Agent质量:
- LLM是基于概率生成答案的,实践经验表明,多次调用往往能提升准确性。但这并不意味着可以不计成本地“暴力求解”。通过评估,可以提前预估成本,避免Agent上线后产生超预期的账单。
控制LLM调用成本:
- 每个Agent都有自己的强项,也有自己的盲区。评估能把这些特性揭示出来,让开发者或用户对Agent建立更全面的认知。
发现Agent的优势与短板:
- 评估中发现的劣势,恰恰是后续优化的方向。针对性改进,才能真正打磨出有竞争力的Agent,给用户带来更好的体验。
助力优化,提升体验:
那么,问题来了:怎么才能做好评估?目前这方面还没有成熟的理论框架,主要面临三大挑战:
- Agent研究的时间还比较短,其定义、构成等都没有形成统一标准,评估方面的研究就更少了。
缺少系统的理论支撑:
- Agent要解决的问题五花八门,有些甚至没有标准答案。评估的好坏往往高度依赖具体场景,不同问题之间的基准数据很难迁移复用。
场景复杂多样,统一标准难寻:
- 对于新场景,评估人员需要从零开始收集数据、制定基准,这个过程的代价不菲。而对于那些连标准答案都不存在的场景,更是需要探索其他的评估方式,目前还没有成熟方案。
缺乏场景化基准,评估成本高昂:
2. 业界Agent评估方法介绍
当前工业界和学术界对Agent评估的研究还处在早期探索阶段,相关的框架和论文不算多,成果也不够成熟。下面挑选几个具有代表性的研究成果来介绍,它们从不同侧面对Agent的能力进行了评估。
2.1. AgentBench:将LLM作为Agent进行评估
AgentBench由清华大学、俄亥俄州立大学和加州大学伯克利分校联合推出并开源。这个框架对27种不同的大模型(涵盖开源与闭源)在8种真实环境中的Agent能力进行了评估。

这8种场景可以归为三类:
- 让LLM生成代码,涉及操作系统、数据库和知识图谱。
编码类:
- 让LLM扮演角色,包括数字卡牌游戏、横向思维谜题和家务游戏。
游戏类:
- 让LLM完成网页相关任务,比如网购和浏览网页。
Web类:
AgentBench对不同LLM在不同环境中的表现进行评分,评分标准因场景而异。比如操作系统和数据库场景主要看成功率,知识图谱场景则使用F1值。论文还采用了一种归一化算法,给每个模型算出一个总分。从结果看,闭源商业模型的平均得分比开源模型高出近1.6倍;具体到各个模型在8个环境中的表现,能力差异相当明显,每个模型都有自己擅长的领域。

2.2. API-Bank:工具增强LLMs的综合基准
API-Bank由阿里巴巴、香港科技大学、北京大学等联合发布,专门针对工具增强的LLMs。它构建了一个包含73个API工具、753个API调用标注的评估系统,用来评估LLM在规划、检索和调用API方面的能力。系统根据是否检索API和调用API的数量,划分了三种场景:
- 根据给定请求直接调用指定API。
直接调用:
- 当不确定该调用哪个API时,先检索再调用。
检索调用:
- 当需要调用多个API时,通过不断规划、检索再调用。
规划检索调用:
评估结果揭示了几个关键信息:GPT-3.5相比GPT-3在工具调用能力上有明显提升,而GPT-4相比GPT-3.5,则在规划能力上展现出了显著优势。
2.3. AgentBoard:多轮LLM Agent分析评估
AgentBoard由港大、浙大、上海交大、清华等高校联合发布,是一个面向多轮LLM Agent的开源评估基准。它在9个不同的任务上对主流LLM的能力进行了多角度分析。

评估的维度相当丰富:
- 除了传统的任务成功率,AgentBoard引入了“处理率”指标。成功率只看最终结果,而处理率能反映任务完成到哪个程度——比如是第一步就失败了,还是到了95%才失败,这是完全不同的两个概念。
处理率(process rate):
- 这个指标衡量的是LLM生成的可执行行动的比例。实验发现,Text-Da vinci-003和Deepseek-67b的grounding精度远低于GPT-3.5-Turbo-16K,但它们的任务成功率和处理率却与GPT-3.5相差不大。这说明虽然它们的工具执行能力偏弱,但在规划等其他能力上可能更胜一筹。
grounding精度:
- AgentBoard根据子目标数量将任务分为简单和困难两个级别。实验表明,所有模型处理困难任务的能力都远低于简单任务——这倒也符合直觉。
简单与困难任务区分:
- 研究发现,对于具身智能和游戏等场景,处理率随着交互轮次的增加收敛较慢;而对于WebArena和Tool-Query这类任务,处理率在前几步就迅速收敛到较高水平。
多回合交互:
- AgentBoard为Agent定义了记忆、规划、grounding、反思、知识获取等能力,并用加权平均算法计算子能力得分。结果显示,GPT-4全面领先,闭源商用模型整体优于开源模型。
子能力分析:
- 针对特定场景(如BabyAI中的房间、AlfWorld的容器等)的评估表明,当前大模型的探索能力普遍较弱。
探索能力:
2.4. MetaTool:针对LLM工具调用的基准
MetaTool由理海大学、华中科技大学、剑桥大学等共同发布,专注于评估大模型使用工具的能力。论文对8个主流模型在“判断是否需要使用工具”和“工具选择”两个维度进行了评估。它构建了一个包含21127个用户请求的数据集,并通过prompt技术生成。工具选择部分又细分为4个场景:
- 从相似工具集合里选出正确的那一个。
相似工具选择:
- 针对特定场景,检测模型是否选对了工具。
特定场景工具选择:
- 判断模型选择的工具是否存在、是否与任务相关。
可靠工具选择:
- 评估模型选择多个工具来解决问题的能力。
多工具选择:

2.5. AI Agents That Matter:重要的AI Agent
这篇来自普林斯顿大学的论文,聚焦于当前Agent评估方法的不足,并提出了一些关键建议:
- 实践中,多次调用LLM确实能提升成功率,但这不意味着成本可以无限投入。论文在HumanEval问题上的实验表明,用相对较少的成本也能获得不错的效果。因此,建议把成本纳入评估指标体系。
评估应考虑成本因素:
- 论文通过修改DSPy框架,在HotPotQA问题上进行联合优化,证明了这种做法是可行的。
成本和准确率应联合优化:
- 过拟合是典型问题。如果给Agent提供的数据集过多,会导致评估结果不准确,必须警惕。
要避免shortcuts:
- 在WebArena和HumanEval的实践中,论文发现Agent评估在标准化和可复用性上仍有很大缺口。
缺乏标准和可复用性:
2.6. PersonaGym:评估角色Agent和LLM
PersonaGym由卡内基梅隆大学、伊利诺伊大学芝加哥分校等联合推出,是一个专门评估角色扮演型Agent能力的动态框架。它使用了包含150个环境、200个角色和10000个问题的基准数据,并提出了PersonaScore量化评估指标。

评估流程分为三个阶段:
- 根据角色描述,从150个环境中选择最相关的,然后初始化角色Agent。
环境选择与角色初始化:
- 系统提出相关问题,由角色Agent作答。
提问与回答:
- 通过两个LLM对回答进行打分,得出综合得分。
PersonaScore计算:
PersonaScore由5个维度的指标组成:
- 角色Agent在特定环境下采取的行动是否合理。
行动合理性:
- 角色Agent是否选择了最佳行动或决策。
行动正确性:
- 回答的语法、语气和整体风格是否妥当。
语言习惯:
- 回答是否与角色属性保持一致。
角色一致性:
- 回答中是否包含不尊重、粗俗或恶意内容。
毒性控制:
2.7. MMRole:开发和评估多模式角色扮演Agent的框架
MMRole由中国人民大学高岭人工智能学院和中国农业大学信息与电气工程学院联合发布,用于开发和评估多模态角色扮演Agent。它构建了一个大规模、高质量的数据集,包含85个特征、11K图片和14K单轮或多轮对话。MMRole-Eval提供了3个维度的8个评估指标,并用训练好的奖励模型进行评分。

8个评估指标具体包括:
- 回答是否准确遵循指令,有没有多余内容。
遵守指令:
- 语法是否正确,表达是否流畅。
流利程度:
- 前后文是否保持连贯,有没有矛盾。
连贯性:
- 回答是否与图像内容相关。
图文相关性:
- 是否准确回答了问题。
回答准确度:
- 是否准确反映了个人的属性。
个人一致性:
- 是否准确反映了角色的知识背景、经验、能力和关系。
知识一致性:
- 回答是否符合角色的典型言语模式和风格,不像AI助手。
语气一致性:
为了减少不同用户或模型给分的偏差,MMRole采用了一种对比方式:对每个指标,用奖励模型对Agent的回答和真实数据进行相对比较,以两个分数之间的比值作为最终得分。
3. 总结和展望
梳理完上述框架和方法,我们可以清晰地看到,当前Agent评估的研究还处于初步探索阶段。这些研究主要集中在几个方面:
- 评估的基准数据集非常稀缺,上述研究大多把大量精力花在了构建不同场景的数据集上,比如AgentBench和AgentBoard在多任务场景上的工作。
基准数据构建:
- 很多研究都涉及工具调用能力,例如API-Bank和MetaTool,从相似工具选择、多工具选择、规划检索等角度进行了评估。
工具调用能力评估:
- 也有一些研究关注Agent的规划、记忆等其他能力,比如AgentBoard利用成功率和加权平均算法来量化这些能力。
规划、记忆等能力评估:
- 指标是评估的核心,不少研究都在探索该用哪些指标,例如AgentBoard、PersonaGym、MMRole都有各自的指标体系。
评估指标探索:
但同时,这些研究也暴露出一些共性的局限:
- 当前的研究大多针对特定场景,数据集从头搭建,耗费巨大。更关键的是,这些数据集缺乏统一标准,很难被其他人复用。
基准数据集缺乏标准和可复用性:
- 这些研究基本都聚焦于“LLM as Agent”,即把大模型本身当作Agent来评估其工具调用等能力。这种方式很难直接迁移到对Agent框架的评估上。
主要评估大模型,而非框架:
总结下来,Agent评估还有很长的路要走。从现状来看,未来的趋势可能会逐渐走向“共相”和“统一”——大家会努力打造可复用的数据集和环境。当前评估主要围绕大模型本身,而对Agent在规划、记忆等更深层次能力上的评估,方法和标准都还不够成熟。此外,对于Agent框架的各方面能力,也还有待进一步研究。在指标方面,目前大多还是“因场景而异”,至于什么样的场景该用什么指标、这些指标是否合理,都还缺乏理论指导。这些问题,很可能就是未来Agent评估领域的主攻方向。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名