首页 > 教程攻略 > ai资讯 >Agent系列之LATS(Language Agent Tree Search)框架解析

Agent系列之LATS(Language Agent Tree Search)框架解析

来源:互联网 时间:2026-08-11 16:54:01

论文摘要

论文提出了一种名为LATS(Language Agent Tree Search)的框架,乍一听名字有点技术味儿,但它干的事儿其实很明确——把语言模型在规划、行动和推理方面的能力串联起来,让决策能力更上一层楼。核心思路借鉴了强化学习中常用的蒙特卡罗树搜索(MCTS),同时利用环境提供的外部反馈,让问题求解过程更灵活、更聪明。实验数据很能说明问题:在HumanEval上搭配GPT-4,LATS拿下了94.4%的编程得分;在WebShop上使用GPT-3.5时,平均分也达到了75.9。在编程、HotPotQA、WebShop这些跨度不小的场景里,LATS都撑得住场面,证明这套方法确实通用且有效。

Agent系列之LATS(Language Agent Tree Search)框架解析

主要内容

方法描述

LATS本质上是一个基于MCTS的推理决策框架,专门为自然语言任务设计。它把一段思考序列当作树上的一个节点,用预训练语言模型给每个节点打分,并根据环境反馈动态调整价值函数。最巧妙的一点是,它还加入了自我反思机制——从失败的轨迹里吸取教训,逐步提升决策质量。表1:关于推理、行动和规划的相关工作的总结。LATS 是第一个结合了这三个领域的设计的工作,使其能够应用于所有相应的任务。我们把搜索算法的使用称为规划,将语言模型生成的反馈用于自我反思,将过去文本语境的存储视为外部记忆,以供将来对解决方案进行更新从表中能清楚看到,LATS把计划、思考、行动、反思和记忆全融到了一起,效果自然更胜一筹。

方法改进

跟传统的MCTS推理框架相比,LATS做了几处关键升级:

  1. 用蒙特卡罗树搜索算法做探索,可以高效地遍历可能的解决方案空间。

  2. 依赖预训练语言模型来评估节点的价值,搜索方向被引导得更准。

  3. 引入了自我反思机制,能从失败中学到东西,决策能力会随着时间自动提升。

解决的问题

场景其实很直观,主要两大类:

  1. 推理问题:给一个问题,LATS能生成一串中间思考步骤,一步步导向最终答案。
  2. 决策问题:面对多个候选选项时,LATS会模拟不同决策路径,然后挑出最优解。

一句话总结,LATS提供了一套灵活、高效且可扩展的方案,专门处理自然语言任务里的推理和决策难题。

实现解析

现在拆解一下LATS的核心流程:节点选择、拓展、评分、执行、反向传播、反思。先从当前节点出发,选择并拓展出若干子节点,每个子节点通过LLM打分。任务一直迭代,直到达到预设步数或找到最优结果,然后反向传播分数,更新所有父节点。输出结果还会经过LLM反思,进一步精炼。下面看看LangChain里是怎么落地这套逻辑的。

主要分为四个步骤:

  1. 选择:根据后续步骤中的总奖励,选出最佳的下一个行动。如果已经找到解决方案或者达到最大搜索深度,就输出响应;否则继续搜索。
  2. 扩展和执行:并行生成N个候选操作(本例中N=5),并逐一执行。
  3. 反思+评估:观察执行结果,结合反思(以及可能的外部反馈)对决策进行评分。
  4. 反向传播:根据评分结果,更新根节点轨迹的整体分数。

概括一下就是:选节点→行动→反思→评分→反向传播。同时根据节点数量上限和结果质量,决定是继续向下探索还是直接输出结论。

总结思考

LATS把计划、思考、行动、反思和记忆融为一炉,借助蒙特卡罗树搜索算法,相比ReAct、ToT、CoT、Reflection这些框架,优势相当明显。下图为各框架的对比示意。

最核心的亮点在于:它同时利用内部反思和外部条件反馈,把两类反馈都当作记忆来存储和复用,从而不断逼近更好的效果。