Al Agent:大模型时代重要落地方向
大语言模型越来越成熟了,随之而来的就是各种基于大语言模型的AI Agent开始频繁进入我们的视野。Agent是什么?它和大模型本身有什么区别?未来又能往哪些方向落地?这篇文章会系统地梳理一下相关的知识点,聊聊大模型时代AI Agent的几个重要方向。

整个分享主要围绕五个方面展开:Agent的整体架构、重点难点问题、用户行为模拟智能体、多智能体软件开发,以及未来的发展方向。
LLM-based Agent 整体架构
一个典型的大语言模型 Agent,由四个核心模块构成。
1. 画像模块
这个模块主要负责描述Agent的背景信息。画像内容主要基于三类信息:人口统计信息(比如年龄、性别)、个性信息,以及社交信息。生成画像的策略也有三种:如果Agent数量不多,可以直接手工设计,然后把用户画像写进大模型的prompt里;如果需要大量的Agent,可以先指定少量画像作为示例,再让大语言模型批量生成更多;还有一种方法是数据对齐,需要根据已有数据集中的人物背景信息来构建prompt,然后做相应的预测。
2. 记忆模块
记忆模块的目的是记录Agent的行为,为它未来的决策提供支撑。记忆结构上,有的只考虑短期记忆,有的则把长期记忆和短期记忆结合起来。记忆的形式一般有四种:语言、数据库、向量表示和列表。记忆的内容操作上,常见的是读取、写入和反思三种动作。
3. 规划模块
规划模块可以分为两大类。一类是不需要反馈的规划,大语言模型在推理过程中不需要外界的反馈就能完成。这里面又分三种:基于单路推理(只调用一次大模型就输出完整步骤)、基于多路推理(让模型生成多个路径,从中选出最佳方案),以及借用外部规划器。另一类则是需要反馈的规划,模型要根据环境、人类或者其他模型的反馈来调整后续的动作。
4. 动作模块
动作模块涉及四个维度:动作目标(完成某个任务、进行交流、还是探索)、动作生成(依靠记忆回想还是按计划执行)、动作空间(是工具集合,还是基于大模型自身知识),以及动作影响(对环境的影响、对自身状态的影响、对未来动作的影响)。
这个整体框架更详细的梳理,可以参考这篇论文:Lei Wang, Chen Ma, et al., A Survey on Large Language Model based Autonomous Agents, CoRR abs/2308.11432 (2023)。
LLM-based Agent 重点&难点问题
当前大语言模型Agent面临的挑战,主要集中在以下几个方面。
1. 如何提升角色扮演能力
Agent的核心任务就是扮演某种角色来完成特定任务或模拟,所以它的角色扮演能力至关重要。这个能力要从两个维度来理解:角色与Agent行为的关系,以及角色在环境中的演化机制。定义了能力之后,就需要评估,包括评估指标和评估场景。最后是提升方法,常用的有两种:一种是通过设计更精巧的prompt来激发模型的能力,另一种是通过外部数据进行微调。
2. 如何设计记忆机制
Agent和大语言模型最大的区别,就是它能在环境中不断自我演化和学习,而这恰恰是记忆机制在起作用。记忆机制的设计通常有两种:基于向量检索的记忆和基于大模型总结的记忆。评估记忆能力需要明确指标和场景,最后还要分析记忆机制的演化与自主更新。
3. 如何提升推理/规划能力
这个领域又细分为两个方向。一是任务分解能力,包括如何定义和拆分子任务,以及如何确定最优执行顺序。二是推理与外界反馈的融合,既要设计出让Agent和环境互相交互的机制,又要提升Agent对外界反馈的响应能力——它不仅要能真实地应对外界,还要能主动提出问题、寻求答案。
4. 如何设计多Agent高效协同机制
多Agent的合作机制主要体现在两个层面。合作机制上,需要定义不同Agent的角色,并设计它们之间的协作方式;辩论机制上,则要设计Agent间的辩论互动,以及确定辩论何时收敛的判定条件。
基于大语言模型的用户行为模拟智能体
下面看几个实际的案例。第一个是基于大语言模型的用户行为模拟智能体,这也是早期将大语言模型智能体与用户行为分析结合的尝试。在这个工作中,每个Agent被划分为三个模块。
1. 画像模块
给不同的Agent指定不同的属性,比如ID、姓名、职业、年龄、兴趣和特征。
2. 记忆模块
记忆模块包含三个子模块:感受记忆、短期记忆和长期记忆。短期记忆会把原始观测数据加工成信息量更高的内容,然后暂时存放;长期记忆则是短期记忆内容经过反复触发和激活后自动转入的,存储时间更长,而且会根据现有记忆进行自主反思和升华提炼。
3. 动作模块
每个Agent可以执行三种动作:在推荐系统中的行为(比如看电影、查找下一页或离开系统)、Agent之间的对话行为,以及在社交媒体上发帖的行为。有趣的是,在整个模拟过程中,每个Agent在每一轮都可以自由选择这三种动作,不受外界干预。通过多轮模拟,不仅能观察到不同Agent之间的对话,还能看到它们在社交网络或推荐系统中自主产生的各种行为,甚至可以从中发现一些有趣的社会现象和用户网络行为规律。
更详细的描述可以看这篇论文:Lei Wang, Jingsen Zhang, et al., When Large Language Model based Agent Meets User Beha vior Analysis: A Novel User Simulation Paradigm。
基于大语言模型的多智能体软件开发
另一个典型案例是用多Agent做软件开发,这也是早期多Agent协作的代表性工作。整个系统的设计思路非常有意思——它把整个团队看作一家软件公司,不同的Agent扮演不同的角色。有的Agent负责设计,包括CEO、CTO、CPO等;有的负责编码;有的负责测试;还有的负责撰写文档。不同Agent各司其职,通过交流和协同机制,最终完整地完成一个软件的开发过程。
LLM-based Agent 未来方向
大语言模型Agent的未来发展,目前可以归纳为两大方向。
第一个方向是
解决特定任务
第二个方向是
模拟现实世界
另外,当前大语言模型Agent还存在两个核心痛点。
第一个是幻觉问题。
第二个是效率问题。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名