一篇大模型Agent工具使用全面研究综述
把大型语言模型(LLMs)和工具学习结合起来?这件事正在成为AI圈子里一个不容忽视的趋势。如果直接问一个LLM“今天北京的天气怎么样”,大概率会得到一个基于训练数据中过时信息的回答——但如果你让它调用一个天气API,结果就完全不一样了。这背后的范式,就是工具学习(Tool Learning),它正成为解决复杂问题的关键路径。
然而这个领域虽然发展迅猛,文献却散落四处,不够系统,新人想入门往往一头雾水。所以,这篇综述把相关研究从两个维度做了全面梳理:
为什么要搞工具学习
具体怎么落地

- (1)为什么工具学习是有益的;
- (2)如何实现工具学习,以全面理解LLMs的工具学习。
沿着工具学习的完整工作流,文章梳理出四个关键阶段来展开讨论:任务规划、工具选择、工具调用以及最终的响应生成。
为什么工具学习是有益的?
一个根本性的判断是:给LLMs装上"工具"这个外设,带来的收益是双向的。一方面,工具的引入能
大幅拓展模型在多个领域的能力
让响应更稳健、生成过程更透明
具体来说,可以从以下六个方面来看:
知识获取
- LLMs的能力受限于预训练期间"刻进"的知识范围,这些知识是静态的,没法动态更新。
- 通过集成搜索引擎、数据库、知识图谱、天气或地图等外部工具,模型就能实时抓取并整合外部知识,从而给出更准确、更贴合上下文的回答。
专业知识增强
- 尤其在那些需要深度专业技能的领域——复杂数学计算、编程、科学问题求解——纯语言模型经常力不从心。
- 但要是能调用在线计算器、数学工具、Python解释器这类专用工具,LLMs就能真正"算"起来,解方程、做统计、跑代码,专业能力立马提升一个台阶。
自动化和效率
- LLMs本质上只是一个语言处理器,没法自己动手在真实世界里办事儿——比如订会议室、买机票。
- 但只要跟外部工具集成,模型就能自动执行这些任务:日程安排、设置提醒、过滤邮件……实用性和交互效率是本质上的飞跃。
交互增强
- 用户的输入五花八门——文字的、语音的、图片的、甚至不同语种的——LLMs要准确理解这些多样化的查询并不容易。
- 多模态工具和机器翻译工具等,可以帮模型更好地读懂"人话",优化对话管理和意图识别,让交互更自然。
增强的可解释性和用户信任
- 现在的大模型大多是个"黑箱",决策过程用户完全看不到,自然缺乏信任。
- 但通过工具学习,模型可以把每一步决策都摊开来讲:先是任务分解、接着挑工具、然后调用并拿到结果、最后合成回答。用户能清楚看到哪一步出了错,信任感也就水到渠成了。
改进的鲁棒性和适应性
- 当前的LLMs对输入很敏感,稍微一点变化就可能生成截然不同的回答,稳定性不够。
- 引入专用工具后,模型就不需要单纯依赖训练数据中的统计模式来"猜"答案了,而是可以借助外部工具获取真实数据来支撑回答,因此对输入扰动的抵抗力和对新环境的适应性都会明显改善。
如何实现工具学习?
说清楚了"为什么要做",接下来就是"怎么做"。按照工具学习的流水线,可以拆成四个核心环节。
任务规划
这是工具学习的起点。用户扔过来的问题往往不是一个简单的问句,背后可能是多个交织在一起的意图。所以第一步,就是要把这个复杂问题拆成若干可执行的子任务,并搞清楚这些子任务之间的依赖关系和执行顺序。这个环节有两种主要思路:一类是
无需调整的方法
基于微调的方法
工具选择
任务拆完了,下一步就是为每个子任务挑一把趁手的"工具"。当系统里的工具数量很少时,直接让LLM自己看工具描述和参数列表来选就行。但一旦工具库膨胀到几百上千个,就需要专门的
检索器
无需调整
基于微调
工具调用
选好了工具,接下来就是真正"干活"了。这里的关键是:LLM必须能从用户的自然语言查询中,准确提取出工具要求的参数格式。比如查天气,就要把"今天"变成日期,"北京"变成城市编码。然后把参数发送给工具服务器,拿到返回结果。这个步骤中,
无需调整的方法
基于微调的方法
响应生成
这是工具学习流程的收尾阶段。模型需要把工具返回的结果和自己的内部知识整合起来,输出给用户一个完整、准确、有用的回答。但这里有一个现实问题:工具的输出可能很长,而LLM的上下文窗口是有限的。所以研究者们想出了几种应对策略:
简化输出
截断输出
压缩信息
无模式方法
工具学习范式
除了具体的步骤,还需要从更高的视角来看:当前的工具学习工作流程,主要可以分为两种范式。
- :模型拿到问题后,一次性规划出所有需要的子任务、选好工具、调用并生成回答。整个过程没有中间反馈。这种做法的好处是简单直接,缺点是一旦中途出了错或者工具返回了意想不到的结果,模型缺乏调整能力。
一步任务解决
- :模型不预先做完整计划,而是先做一步,看看工具返回了什么,再根据反馈决定下一步。这种方式更灵活、更动态,模型能边干边学,响应反馈做调整,应对复杂问题的能力更强。
迭代任务解决
这里的关键差异就体现在"规划有无反馈"上——一步范式是规划无反馈,迭代范式是规划有反馈。后者的优势在面对真实世界的不确定时尤为明显。
工具学习评估基准与指标
说来说去,最终还是要落到"怎么评价"上。针对前面提到的四个阶段,评估指标各有侧重:
- :看模型能否准确判断"什么时候该用工具",以及规划出来的任务解决路径是否有效(常用通过率、人类评估、与最优方案对比的精确度)。
任务规划评估
- :主要看召回率——推荐的工具列表里有多少是确确实实需要的;另外还有NDCG(排序质量)和COMP(选择集合的完整性)。
工具选择评估
- :检查调用的参数是否符合工具文档的规定,调用是否成功。
工具调用评估
- :最终要回归到任务本身——生成的回答质量如何?常用ROUGE-L、精确匹配、F1分数等指标来衡量。
响应生成评估
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名