TRAD:通过步骤级示范检索和决策对齐来增强大型语言模型Agent的性能
来源:互联网
时间:2026-07-30 13:52:08
如今,基于大语言模型的智能体(LLM Agent)已经遍地开花,从网页导航到在线购物,各种任务都能看到它们的身影。这很大程度上归功于LLM强大的知识储备和文本理解能力——通过上下文示例(in-context examples)就能快速泛化,连微调都不需要。不过,细看之下会发现,大多数研究把重点放在了“构建Agent”上,却很少有人认真琢磨:这些上下文示例该怎么选、怎么用,才能发挥最大效果?
最近有人提出了轨迹级检索的方法,把整条专家轨迹当作示例喂给Agent,在顺序决策任务上确实有所改善。但问题也随之而来:检索到的示例往往缺乏任务专属的状态转换细节,而且输入太长,塞进去大量不相关的上下文,反而成了噪声。这就像你让一个新手看一整段围棋高手对局的棋谱,但没告诉他当前局面下最关键的那几步该怎么走——信息太多,反而抓不住重点。
针对这个痛点,一个新框架
TRAD(Thought Retrieval and Aligned Decision)
图1:TRAD Agent(在ALFWorld环境中)的整体示意图
见图2

图2:对齐决策方法的一个示例
时间扩展
相对顺序标记
历史对齐
在ALFWorld和Mind2Web两个标准测试集上,TRAD不仅全面超越了当前最先进的模型,而且有效降低了噪声干扰、提升了泛化能力。更值得一提的是,这套方法已经在一家全球商业保险公司落地,实际提升了机器人流程自动化的成功率。从实验到生产,这一步走得相当扎实。
ALFWorld与Mind2Web评测结果
比较Synapse基于任务元数据的轨迹级检索与TRAD基于思考的步骤级检索
(a) Synapse
(b) Synapse
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名