Agent Q:AI 智能体新突破,赋予其高级推理和学习能力
要说最近AI圈最火的话题,大型语言模型(LLM)绝对算一个。从ChatGPT到Gemini,前沿模型的推理能力越来越强,在很多领域的表现已经接近甚至超越了人类平均水平。这些突破让LLM不再只是聊天工具,它们开始扮演更动态的智能体角色——不仅能生成文本,还能在各种环境里自主操作。
然而,一个硬骨头依然摆在面前:LLM在交互式、多步骤的环境里,泛化能力还是跟不上。MultiOn公司的研究人员盯上了这个难题,他们的目标很明确——让智能体能靠自主经验和有限的监督去自我进化。于是,Agent Q诞生了。这个框架把推理、搜索、自我批评和强化学习几个关键概念揉在了一起,思路相当清晰。

AI 智能体也能“随机应变”?Agent Q 来了!
Agent Q的设计灵感来自Sutton那句著名的“痛苦教训”——那些能随着计算量增加而不断扩展的通用方法,往往能爆发出惊人的力量。换句话说,搜索和学习的结合,才是真正的王道。Agent Q的核心,就是靠蒙特卡洛树搜索(MCTS)来引导智能体探索不同的行动路径,同时引入AI自我批评机制,每一步都提供反馈,帮决策过程不断优化。
图1把整个过程展示得很清楚:Agent Q用MCTS指导轨迹收集,再用直接偏好优化(DPO)迭代地改进模型。它从数据集的任务列表里采样用户查询,用UCB1作为启发式方法,在树里迭代扩展,平衡探索和利用。每个节点存储累积奖励,深绿色代表高奖励,深红色代表低奖励。为了构建偏好数据集,Agent Q会计算MCTS平均Q值的加权分数,再加上反馈语言模型给出的分数,形成DPO需要的对比对。策略就这样一步步优化,循环上升。
Agent Q 的三大核心组件:
1. 引导式搜索与 MCTS:自主探索,寻找最佳路径
Agent Q利用引导式蒙特卡洛树搜索来自己生成数据,探索不同的操作和网页,平衡探索和利用。MCTS用高采样温度和多样化提示来扩展操作空间,确保收集到的轨迹既多样又高质量。
图2展示了Agent Q在WebShop任务上的表现,跟RFT和DPO做了对比。所有模型都基于xLAM-v0.1-r。在基础模型上,RFT和DPO分别把成功率从28.6%提到31.3%和37.5%。但跟人类平均水平的50.0%还有差距。而Agent Q + MCTS直接干到了50.5%,相对改进了76.57%,一举超越了人类平均线。
2. AI 自我批评:不断反思,优化决策过程
每个步骤里,AI自我批评机制都会给出反馈,帮Agent Q优化决策。这种步骤级的反馈对长任务特别重要——稀疏信号往往让学习变得异常困难。
图3展示了自我批评的运作过程:在推理时,策略每一步提出K个动作,评估器(跟策略用同一个基础LLM初始化)对这些动作打分排序。这个排名既用来指导树里节点的扩展,也在训练时用来构建偏好对。
3. 直接偏好优化:从经验中学习,提升成功率
Agent Q采用直接偏好优化算法来微调模型,从MCTS生成的数据里构建偏好对。这种离线训练的方式,让模型能从聚合数据集里高效学习,连搜索时探索过的次优分支也不放过,从而提升复杂环境里的成功率。
算法1给出了MCTS引导的直接偏好优化算法的具体流程。
Agent Q 初露锋芒:在真实世界中超越人类表现
在Open Table上的真实预订实验里,Agent Q把LLaMa-3模型的零样本性能从18.6%直接拉升到81.7%,增幅高达340%,而且只用了一天自主数据收集。要是再打开在线搜索功能,成功率还能冲到95.4%。这些数字背后传递的信号很明确:Agent Q这套方法,在提升自主Web智能体效率上确实有两把刷子。
图4汇总了不同方法在OpenTable上的成功率。除非特别说明,所有模型都基于LLaMA-3-70B-Instruct。用DPO和带MCTS的RFT,分别把性能从18.6%提到71.8%和84.3%。Agent Q自己达到了81.7%,而Agent Q + MCTS则一骑绝尘,做到了95.4%。
图5展示了轨迹结束时如何调用GPT-4-V评估器——根据最终观察和动作历史,给出智能体性能的反馈,确定成功分数。模型会收到轨迹的简要执行历史和最终状态的截图。成功指标就是一个简单的0/1二进制值。
研究人员给Agent Q提供了固定的输入格式:包括系统提示、执行历史、当前观察(以DOM形式呈现)和包含目标的用户查询。智能体的输出则拆分为整体的逐步计划、思考、命令和状态代码几个部分。
图6展示了输入格式和输出格式的具体样例。
迈向未来:Agent Q 开启网络世界自动导航新时代
必须承认,MultiOn的Agent Q为自主Web智能体树立了一个新的重要里程碑。它把先进的搜索技术、AI自我批评和强化学习捏合在一起,克服了当下不少局限性——这代表着自主智能体能力的一次重大飞跃。更让人期待的是,这项突破性的研究成果计划在今年晚些时候向开发者和消费者用户开放。智能体在网络上自主导航的时代,或许比我们想象的来得更快。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名