新兴人工智能Agent架构的综述:推理、规划和工具调用
来源:互联网
时间:2026-08-01 14:29:17
自ChatGPT推出以来,第一波生成式AI应用几乎都基于检索增强生成(RAG)模式,用于在文档语料库上进行聊天。然而,随着技术演进,下一代AI应用正在聚焦一个共同主题——
智能体(Agent)
规划
循环
反思
其他控制结构
工具、插件和函数调用
单智能体
多智能体
智能体(Agent)分类
AI智能体被定义为一个由语言模型驱动的实体,能够在多轮迭代中规划并采取行动以实现目标。智能体架构可以是单一智能体,也可以是多个智能体协同工作解决问题。
图1:单智能体与多智能体架构及其底层特性和能力的可视化展示。
具体来说,我们可以从以下几个关键维度来理解智能体:
- :即由语言模型驱动,能规划并执行多轮迭代来达成目标的实体。
AI智能体定义
- :架构可以是单智能体独自完成,也可以是多智能体协作解决特定问题。
单智能体与多智能体架构
- :每个智能体被赋予特定的角色或个性,包括该智能体独有的指令,以及它所能调用的工具描述。
智能体角色(Agent Persona)
- :在AI智能体语境下,工具指模型可以调用的任何功能,使智能体能够与外部数据源交互。
工具(Tools)
- :由一个语言模型驱动,独立完成所有推理、规划和工具执行。该模式没有其他AI智能体的反馈机制,但可能包含人类反馈的选项。
单智能体架构
- :涉及两个或更多智能体,它们可以使用相同或不同的语言模型集合,每个智能体通常有自己独特的角色。
多智能体架构
- :多智能体架构可细分为垂直型(有主导智能体)和水平型(所有智能体平等参与,共享信息和任务)。
垂直与水平架构
- :包括“大脑、感知和行动”,这是理解、推理和与环境互动的最小需求。
智能体的三个组成部分
单智能体(Single Agent)架构
单智能体架构由一个语言模型驱动,独立执行所有推理、规划和工具执行。成功的关键在于适当的规划和自我修正能力。这类架构在执行直接功能调用且无需其他智能体反馈时特别有用。
单智能体方法示例
ReAct
图2:ReAct方法与其他方法比较的一个示例
RAISE
图3:展示了RAISE方法的图表
Reflexion
AutoGPT + P
图4:AutoGPT+P方法的图解
LATS
尽管单智能体架构在多个方面取得了进展,但它们仍面临挑战:理解复杂逻辑、避免幻觉(hallucination),以及在需要多样性、探索和推理的任务上提升性能。
多智能体(Multi Agent)架构
多智能体架构涉及两个或更多智能体,每个智能体可以使用相同的语言模型或不同的语言模型集合。它们通过智能体之间的沟通和协作计划执行来实现目标。这类架构通常涉及动态团队构建,以及在规划、执行和评估阶段对团队成员进行智能分工。多智能体架构主要分为两大类:
垂直架构
水平架构
多智能体架构示例
Embodied LLM Agents Learn to Cooperate in Organized Teams
图5:有指定领导者的智能体团队实现了更优越的表现
DyLAN (Dynamic LLM-Agent Network)
AgentVerse
图6:AgentVerse方法的图解
MetaGPT
尽管AI智能体技术前景广阔,但仍存在一些挑战:建立全面的基准测试、确保现实世界的应用性,以及减轻语言模型的有害偏见。此外,从静态语言模型向更动态、自主的智能体发展的转变,旨在为使用现有或开发定制智能体架构的研究提供全面的理解和指导。
论文原文:THE LANDSCAPE OF EMERGING AI AGENT ARCHITECTURES FOR REASONING, PLANNING, AND TOOL CALLING: A SURVEY https://arxiv.org/pdf/2404.11584.pdf
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名