新兴人工智能Agent架构全景:用于推理、规划和工具调用的综述
来看看这份关于AI Agent的综述,它系统梳理了当前Agent在推理、规划和工具调用方面的能力边界。研究的核心目标很明确:搞清楚现有Agent到底能做什么、不能做什么,分享一些在实际运行中观察到的规律,并给未来的Agent设计提供几个关键思路。方法上,这篇综述盘点了单Agent和多Agent两种主流架构,找出了不同设计中的共性模式和关键分歧,并评估了它们对最终目标的影响。可以这么说,它在选择Agent架构时涉及的几个核心问题——比如领导力怎么影响系统表现、Agent之间该如何沟通、以及规划、执行和反思这些关键阶段如何塑造一个健壮的Agent系统——都给出了很有价值的梳理。
1、问题背景
1、问题背景
从GPT-4这样的基础模型研究开始,到AutoGPT和BabyAGI这些开源项目引爆社区,研究者们一直在尝试构建能够自主行动的Agent系统。
跟我们平时对大模型做“零次提示”不同——你在对话框里输入一句,它直接给个结果——Agent系统要复杂得多。它引入了规划、循环、反思这些控制结构,让模型能一步步推理,端到端地完成任务。再加上调用工具、插件、函数的能力,Agent就有了处理更通用任务的潜力。
社区里现在有个很有意思的争论:到底是用一个Agent单干,还是搞一群Agent群策群力?结论是,如果问题定义明确、不需要外部角色或用户反馈,单Agent架构就很高效;反之,当任务需要协作、需要并行处理多条路径时,多Agent架构的优势就体现出来了。
1.1关键术语
Agent:
Agent角色:
工具:
单Agent架构:
多Agent架构:
垂直架构:
水平架构:
1.2 开发挑战与未来趋势
- 管理多个模型和Agent不是件容易事。你得让平台既能灵活配置不同的Agent,又能支持各种流程(标准操作流程SOP或动态工作流),还得搞定一对一或广播式的通信模式。对开发者来说,最理想的就是一个既功能强大又简单易用的平台。但鱼和熊掌,想兼顾就得精心设计和权衡。
多Agent系统开发的复杂性:
- 大模型本身就有幻觉、指令理解不到位这些问题,再加个外部工具,不确定性就更大了。在多Agent系统里,一个错误很可能像病毒一样扩散。虽然大模型能帮忙识别错误,但能不能让它自行修复、并给出必要的修正信息,这还是个不小的挑战。
容错机制:
- 支持图像、音频、视频等多模态数据需要一套从头到尾的体系化方案,从存储、展示到用户交互、消息传输。难题在于保证数据一致性、保持高性能,还不能把概念搞复杂。目前还没有一个通用的平台级编程接口来专门处理这个。
多模态数据兼容:
- 工业场景下,Agent可能分别由不同组织管理、运行在不同的机器上。这就要求开发者具备分布式系统编程和优化的专业知识。调试这类应用会额外费劲,因为问题会分布在各个进程或Agent里。如何高效地解决这些棘手问题,对开发人员来说是个硬骨头。
分布式应用的编程与系统设计:
2、有效Agent的关键考虑因素
2、有效Agent的关键考虑因素
2.1 概述
Agent的使命,就是扩展语言模型的能力,去解决真实世界的难题。要做到这一点,它必须能推理、能规划,还得会调用工具来跟外部环境互动。这三大能力缺一不可。
2.2 推理和规划的重要性
推理是人类解决问题的基本能力。如果Agent要自主决策、协助人类,就必须有强大的推理能力。推理和行动是紧密咬合的——这种协同让Agent能快速学习新任务,在没见过的情况下也能做出靠谱的判断。更重要的是,Agent需要根据新的反馈来调整自己的计划。没有推理能力,Agent很可能误解指令、答非所问,或者根本想不到多步操作带来的连锁反应。
规划,正是以推理为基础的。它大致有五种方法:任务分解、多计划选择、借助外部模块、反思完善和记忆增强。这些方法让Agent能把大任务拆成小任务、从一堆方案里选一个、用现成的外部计划、根据新信息修订旧计划,或者利用外部信息来优化方案。大多数Agent模式都有专门的规划步骤,在执行动作前先启动这些技术。比如“像图表一样规划”这个方法,就是把计划画成有向图,让多个步骤同步执行。这对于那些包含很多独立子任务、适合异步执行的任务来说,能带来显著的效率提升。
2.3 有效工具调用的重要性
Agent能抽象地调用多个工具来解决问题,这正是它优于普通提示的关键。工具让Agent能跟外部数据源互动、调用API发消息、或者检索信息。通常,需要大量工具调用的问题,也正是需要复杂推理的问题。无论是单Agent还是多Agent架构,都可以通过“推理+工具调用”的组合来攻克难题。很多方法会反复推理、调用记忆、进行反思,一步步准确解决问题。典型做法就是先拆分问题,再依次用合适的工具解决每个子问题。
但单Agent模式在处理长序列任务时常常力不从心。这个时候,多Agent模式的优势就来了——它能把复杂问题先分解成几个小任务,然后每个Agent用自己独立的工具包去独立处理,既解决了并行任务,也提高了系统的稳健性。
3 单Agent架构
3 单Agent架构
3.1 概述
这一节,我们来盘点几个经典的单Agent方法:ReAct、RAISE、Reflexion、AutoGPT + P和LATS。它们有的优化了推理步骤,有的加入了记忆和反思,核心都是为了让Agent在行动前能好好“琢磨”一下。
3.2 关键主题
Agent能不能成功完成任务,关键在于规划和自我纠正。如果既不会自我评估,也搞不出有效计划,单Agent很可能陷入无限循环,完不成任务,或者给一个不符合预期的结果。反过来,当任务只需要直接调用函数、不需要其他Agent给反馈时,单Agent架构就特别好使。
3.3 例子
ReAct(Reason + Act):
RAISE:
Reflexion:
AutoGPT + P(规划):
LATS(语言Agent树搜索):
4 多Agent架构
4 多Agent架构
4.1 概述
这里我们来看看几个典型的多Agent架构:团队型Agent、DyLAN、AgentVerse和MetaGPT。它们展现了Agent之间如何通过沟通和协作来共同完成目标。这不是一份完整的列表,而是为了覆盖多Agent模式的关键主题。
4.2 关键主题
多Agent架构带来了分工和反馈的巨大优势。很多架构分阶段工作,团队在每个阶段(规划、执行、评估)动态组建和重构,让专业Agent在特定任务上发挥最大作用,用完了就撤。这种“按需组队”的方式能提高准确率、缩短达成目标的时间。一个高效的多Agent系统,关键特征包括:团队里有明确的领导、能动态组队、成员之间能高效共享信息,避免关键信息在无效交流中丢失。
4.3 例子
团队型Agent:
论文还强调了“批评-反思”步骤对生成计划、评估性能和动态重组团队的重要性。结果进一步表明,采用动态团队结构和轮换领导的方式,在完成时间和平均通信成本上是最优的。领导力和动态结构,实实在在地提升了整个团队的推理、规划和执行能力。
DyLAN(动态LLM Agent网络):
AgentVerse:
MetaGPT:
5 讨论与观察
5 讨论与观察
5.1 概述
综合来看,无论是单Agent还是多Agent架构,在复杂目标执行上都表现出了令人瞩目的性能。而且,有几个方法被反复验证是有效的:明确的反馈、任务分解、迭代改进和角色定义——跨架构都管用。
5.2 关键发现
选择单Agent还是多Agent的典型条件:
多Agent架构则更适用于需要多个角色反馈的任务,比如文档生成,一个Agent写、另一个Agent给反馈。它在需要跨不同任务或工作流程并行化时也特别有用。而且王等人的研究还发现,在没提供示例的情况下,多Agent模式的性能优于单Agent。当然,复杂性也更高,通常需要靠谱的对话管理和清晰的领导。
虽然多Agent在范围上更广,但研究也指出:“当提供给Agent的提示足够强大时,多Agent讨论并不一定会增强推理能力。”所以,选择单Agent还是多Agent,更应该基于用例的宏观背景,而不是单纯看推理能力的高低。
Agent和异步任务执行:
反馈和人类监督对Agent系统的影响:
引入人类监督还能让Agent的回应更贴近人类预期,减轻它采用低效或无效方法的风险。到目前为止,整合人类验证和反馈的Agent架构,结果更可靠、更可信。
不过要小心,大模型本身有“阿谀奉承”的倾向,容易“反映用户的立场”,哪怕这意味着放弃客观或平衡的观点。AgentVerse论文就描述了Agent对其他Agent的反馈容易受影响,即使反馈不合理。这可能导致团队制定错误计划、偏离目标。强大的提示可以缓解这个问题,但开发Agent应用的人必须意识到,用户反馈或Agent反馈系统里潜藏着风险。
团体对话和信息共享的挑战:
在垂直架构里,任务通常按技能划分清楚了,有助于减少分心。但新的问题又来了:领导Agent可能忘记给支持Agent发送关键信息,或者没意识到其他Agent不知道某些必要信息。这会导致团队混乱或结果幻觉。一个解决办法是在系统提示中明确告知Agent访问权限,让它进行情境恰当的交互。
角色定义和动态团队的影响:
根据需求动态引入和移除Agent,也被证明是有效的。确保每一轮参与任务规划或执行的Agent都是该轮最合适的,能带来更佳结果。
5.3 总结
在涉及推理和工具执行的复杂任务中,单Agent和多Agent模式都表现出了强大的性能。当一个Agent获得明确定义的角色、一套工具、人类反馈的机会以及迭代前进的能力时,它能做得很好。而当我们要构建一个Agent团队来合作完成复杂目标时,至少部署具备以下一个关键要素是很有帮助的:明确的领导者、明确划分的规划阶段和根据新信息完善计划的机会、智能的消息过滤,以及由拥有特定技能的Agent组成的动态团队。如果一个Agent架构采用了至少一种这些方法,它的表现大概率会比没有这些策略的Agent系统要好。
6 现有研究的局限性及未来研究的考虑
6 现有研究的局限性及未来研究的考虑
6.1 概述
尽管Agent架构在很多方面都提升了语言模型的能力,但它在评估、整体可靠性以及继承自大语言模型的问题上,依然面临重大挑战。
6.2 Agent评估的挑战
大模型有自己的标准评测基准,但Agent领域的基准却五花八门。很多研究团队在提出自己的Agent实现时,也顺手带了一套独特的基准。这导致不同Agent实现很难在同一个基准上公平对比。而且,很多Agent基准是手工制作、小规模、高度复杂的,结果也是靠人来评分。虽然这种方法能提供高质量评估,但容易因规模小、评分者开发了该方法本身而引入偏见。由于模型、环境或问题状态的变化,Agent在多次迭代中生成一致答案也可能有问题。这种随机性对小规模、复杂评估集的影响更严重。
6.3 数据污染和静态基准的影响
有些研究者用典型的LLM基准来评估自己的Agent实现。但新兴研究表明,大模型的训练数据中存在显著的数据污染——当基准问题被稍作修改,模型的表现就明显恶化。这给大模型及其Agent的基准分数真实性打了一个问号。
另外,大模型发展太快,现有数据集往往跟不上它的能力进化。为了解决这个问题,研究者开始创建对“死记硬背”有抵抗力的动态基准,也有人探索完全用合成数据生成基准的想法。但这些方法可能减少人类参与,又会引入正确性和问题解决能力的风险。
6.4 基准范围和可转移性
很多LLM基准(如MMLU、GSM8K)都是单次迭代就能解决的,不涉及工具调用。它们虽然是衡量基础模型能力的重要工具,但绝不是Agent能力的良好袋里——因为没考虑到Agent系统在多个步骤上推理或访问外部信息的能力。StrategyQA在这方面好一些,评估了模型多步推理的能力,但答案仅限于“是/否”。随着行业向Agent场景转型,我们需要更多新指标来评估Agent在工具调用任务上的性能和泛化能力。
一些Agent专属基准(如AgentBench)评估大模型在网页浏览、命令行、游戏等多种环境下的表现,这提供了一个更好的泛化能力指标。AgentBench和SmartPlay等基准引入了成功率、输出与人类响应的相似度和整体效率等客观指标。这些很重要,但也要考虑更微妙或主观的指标,比如工具使用效率、规划的可靠性和稳健性。这些指标虽然几乎和成功率一样重要,却更难衡量,往往需要人类专家评估,耗时又费钱。
6.5 现实世界的适用性
很多现有基准聚焦于逻辑谜题或视频游戏。评估这些任务能了解Agent的推理能力,但不清楚这种表现能否转化到真实世界中去。真实世界的数据往往充满噪声,覆盖的领域也更广。
一个使用真实数据的流行基准是WildBench,它源自570,000次与ChatGPT的真实对话,涵盖了海量任务和提示。虽然WildBench很广,但大多数其他真实世界基准都侧重于特定任务。例如SWE-bench,它使用GitHub上的一组Python软件工程任务。这对于评估专门写Python代码的Agent很有用,但如果要了解Agent在其他编程语言上的能力,信息量就不够了。
6.6 Agent系统中的偏见和公平性
大语言模型在评估、社交或公平性上已知存在偏见。而且,Agent“不够健壮,更容易产生更有害的行为,并且能生成比LLMs更隐蔽的内容”,这凸显了重大的安全挑战。其他研究发现,“尽管被指示从特定整治角度进行辩论,但语言模型Agent倾向于符合模型固有的社交偏见”。这种倾向会导致基于Agent的实现中间出现错误推理。随着任务复杂度和Agent参与度的增加,我们需要更多研究来识别和解决系统内的偏见。这对研究者来说是个非常大的挑战,因为可扩展且新颖的基准在创建过程中往往离不开大模型的参与,但真正稳健的偏见评估基准,必须包含人类评估。
7 结论与未来方向
7 结论与未来方向
这篇调研覆盖的AI Agent实现,展示了大语言模型在推理、规划和工具调用方面的快速进步。无论单Agent还是多Agent模式,都已经具备了解决复杂、多步问题的能力。核心洞察是:没有一种放之四海而皆准的最佳架构,最好的方案因用例而异。但不管选哪种架构,高性能的Agent系统往往至少会用到以下一种方法:明确定义的系统提示、清晰的领导和任务划分、专用的推理/规划-执行-评估阶段、动态的团队结构、人类或Agent的反馈,以及智能的消息过滤。采用这些技术的方法,在各种基准和问题类型上都更有效。
尽管前景令人鼓舞,但局限性和未来改进空间也很明显。短期来看,我们需要解决全面Agent基准缺失、真实世界适用性不足,以及减轻有害偏见等挑战,才能实现可靠的Agent。通过梳理从静态语言模型到动态自主Agent的发展脉络,这篇调查希望能为研究者和工程师们提供一个关于当前AI Agent格局的整体认识,也为那些正在使用或开发定制Agent架构的人,提供一些有价值的参考。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名