一篇大模型Agent的全面综述
来源:互联网
时间:2026-08-23 14:08:08
一直以来,AI领域的终极目标就是打造能媲美甚至超越人类水平的智能系统。而AI Agent,目前被普遍认为是最有希望的载体——简单来说,Agent就是能感知环境、做出决策并采取行动的智能体。这篇文章会系统梳理基于LLM的Agent:先解释为什么大语言模型(LLM)适合做Agent的“大脑”,再给出一个包含大脑、感知、行动三大核心组件的框架,最后展示不同场景下的应用定制。
为什么LLM适合作为Agent大脑的主要组成部分?
- :通过在大规模文本数据上的预训练,LLM能够获取丰富的知识,包括语言知识、常识知识以及特定领域的专业知识。
知识获取能力
- :LLM展现出了对自然语言指令的理解能力,这使得它们能够遵循用户的指令并据此做出决策。
指令理解
- :LLM在预训练过程中学习到了广泛的语言模式,这使得它们能够在没有明确编程的情况下处理各种任务。
泛化能力
- :LLM能够进行一定程度的逻辑推理和规划,这对于Agent在复杂环境中做出决策至关重要。
推理和规划
- :LLM能够与用户进行自然的多轮对话,这有助于Agent更好地理解用户的需求和上下文。
交互能力
- :LLM具有一定的自我改进能力,它们可以通过反馈学习来优化自己的行为和决策。
自我改进
- :LLM可以通过微调来适应特定的任务或领域,这为Agent的定制化提供了可能。
可扩展性
- :尽管LLM主要处理文本数据,但它们也可以与其他类型的输入(如视觉、听觉)结合,以支持更丰富的感知能力。
多模态处理
...
Agent大脑

基于LLM的Agent的大脑模块,是整条链路的核心。它负责存储知识、记忆,并执行信息处理、决策制定、推理和规划等关键任务。这块的研究非常多,可以细分为5大模块:
- :
自然语言交互
- 高质量的文本生成——LLM如何生成准确、流畅的文本,以及如何通过不同方法控制风格和内容。
- 深入理解,包括对用户指令的意图和含义的捕捉。
- :
知识
- 预训练模型中的知识:LLM在预训练阶段如何吸收和记忆知识,这些知识如何帮助Agent理解世界。
- 语言知识:语法、语义和语用学。
- 常识知识:日常世界的事实,如物体用途、事件结果等。
- 可操作知识:与特定任务或领域相关的知识,如编程、医学等。
- 潜在问题:如何处理LLM中的不正确或过时知识,以及如何减少幻觉现象。
- :
记忆
- 记忆能力,包括提高Transformer模型长度限制的方法。
- 记忆的总结和压缩。
- 记忆检索,包括自动检索和交互式检索。
- :
推理与规划
- 推理,如链式推理和其他推理方法。
- 规划,包括计划制定和计划反思。
- :
可转移性与泛化
- 未见任务泛化,如多任务学习。
- 上下文学习,即模型通过上下文中的示例进行学习。
- 持续学习,指模型在不断学习新任务的同时保留以前的知识。
大脑模块的设计灵感来自人类大脑——它不仅是信息处理的中心,也是决策和创造性思维的源泉。在LLM基础的Agent中,大脑模块通过模仿这些人类智能的方面,使Agent展现出智能行为,适应并处理各种任务和环境。
Agent感知
- :这是LLM Agent的主要输入方式。
文本输入
- :
视觉输入
- :通常使用ViT、VQVAE等不同类型的视觉编码器,将图像转换为模型可理解的格式。
视觉编码器(Visual Encoder)
- :通过查询(Query-based)或投影(Projection-based)方法将视觉信息与LLM结合。
可学习的架构(Learnable Architecture)
- :
听觉输入
- 一般使用音频编码器(如HuBERT、AST等),Agent还可以串联多个音频处理模型,如Text-to-Speech等。
- :如触觉、手势等。
其他输入
Agent行动
- :LLM Agent生成文本响应,包括对话、回答问题、撰写报告等。
文本输出
- :
工具使用
- :Agent通过示范学习或反馈学习来使用各种工具。
学习工具
- :Agent调用外部工具(如搜索引擎、数据库、APIs等)来增强自身能力。
使用工具
- :Agent创造或修改工具以适应特定任务或需求。
制作工具
- :Agent在物理世界或虚拟环境中执行具体动作,如移动、抓取、操作对象等。
具体行动
Agent应用
- :
单一Agent
- :Agent根据用户的具体指令执行任务,例如网页浏览、家庭自动化、客户服务等。
任务导向
- :Agent在科学研究、药物发现、新材料设计等创新领域的应用。
创新导向
- :Agent在开放和持续的环境中(如Minecraft)进行长期生存和发展。
生命周期导向
- :
多Agent交互
- :Agent在需要团队合作的场景中协同工作,通过角色分配和任务协调提高效率。
合作交互
- :Agent在竞争环境中通过对抗和辩论提升自身性能和决策质量。
对抗交互
- :
人机交互
- :人类作为指导者提供指令和反馈,Agent作为执行者完成任务。
指导者-执行者模式
- :Agent作为人类的平等伙伴参与对话和任务,例如情感交流和创造性工作。
平等伙伴模式
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名