迈向长程智能体,人大高瓴发布149页全景综述
过去几年,大模型已经从单轮聊天机器人,快速演变为软件工程、深度检索、计算机操作、多模态交互与科学发现中的决策核心。新的问题随之出现:
一个智能体即使单步表现足够聪明,能否在数百、数千次相互依赖的行动中始终记得目标、修正错误、管理上下文,并可靠安全地把任务做完?

这正是
长程智能体(Long-Horizon Agents)
该时间跨度大约每 7 个月翻一倍;从 2023 年后,翻倍周期进一步缩短至约 4 个月
图 1 前沿智能体可完成任务的时间跨度持续增长
值得强调的是:智能体“跑得久”,并不等于“具备长程能力”。真正的关键,不在于占用更多时间与算力,而在于
能否在更长、更复杂、更真实的推理依赖链上持续、有效地行动
外部脚手架工程 × 内部模型优化
论文标题:Towards Long-Horizon Agents: A Survey
项目主页:https://long-horizon-agents.github.io/
论文链接:https://openreview.net/forum?id=HyhfhlbWGh
项目仓库:https://github.com/RUC-NLPIR/Awesome-Long-Horizon-Agents
目前该综述刚发布就在小红书、GitHub、X 等社交平台上收获极高的关注度与反响。
为什么长程任务难:单步错误的积累会导致整条轨迹失控
长程任务的难点并不只是某一步是否答对,而是大量紧密耦合的步骤必须组成一条连贯轨迹。单步看似微小的偏差,在长链条中会被反复继承和放大。论文将典型失败归纳为三类:
- :执行数千步后,Agent 逐渐偏离最初目标;局部错误不断叠加最终把整条轨迹带向错误方向。
目标漂移与误差累积
- :上下文并非越长越好。随着历史推理轨迹和工具输出的不断堆积,模型可能会出现性能骤降,也可能因感知到窗口将满而过早结束任务。
上下文腐化与窗口压力
- :很多任务只在最后给出奖励信号,这使得中间决策难以获得准确归因;而任务执行过程越长,出现误删数据、错误授权或错误操作等不可逆操作的风险越高。
稀疏、延迟奖励与不可逆行动
这意味着,单纯扩大参数量或上下文窗口并不能解决全部问题。一个模型即使拥有更强推理能力,如果缺少计划维护、状态持久化、工具治理、验证和恢复机制,仍可能在长轨迹中迅速失控。
核心论点:智能体外部和内部协同进化
基于上述挑战,本综述提出的核心论点:
“长程智能体能力” 是系统级能力,它源于外部 “脚手架工程(Harness Engineering)” 与内部 “模型优化(Model Optimization)” 的协同演进。
理解长程智能体的关键是把视线从模型单体移向由模型与 Harness 共同构成的完整系统。模型提供推理和行动的策略;而 Harness 则负责进一步支持模型决策的执行,包括组织上下文、维护状态、调度工具、编排流程,并对关键步骤进行验证与恢复。二者共同决定智能体能否沿着一条漫长而相互依赖的轨迹稳定前进。因此,长程能力应被视为整个 Model-Harness 系统的属性,而不是基础模型的一项孤立指标。
论文进一步提出一条双向演化路径:如图 2 所示,Harness Engineering 先把计划、记忆、工具和验证等能力外置,用工程手段迅速拓展模型的能力边界;系统在真实交互中积累的轨迹与反馈,再通过 Model Optimization,用数据 / 环境构造、微调、强化学习、蒸馏和自进化等策略逐步沉淀到模型内部。模型变强后,又能驾驭更复杂的 Harness。外部能力扩展与内部能力吸收由此形成持续循环。
图 2 长程智能体研究全景:外部脚手架工程与内部模型优化共同进化
三层长程阶梯:从长窗口推理,到跨会话记忆,再到跨任务泛化
本论文不以“运行时长”作为长程任务的唯一标准,而是考察任务是否包含大量相互依赖的逻辑决策,以及这些依赖需要跨越多大的执行边界。如图 3 所示,本文提出 H1 - H3 三层任务与 C1 - C3 三层能力的阶梯框架:
任务层级:
- :单上下文窗口内完成,但不是一次回答就结束;须在持续交互中,把相互依赖的决定组成连贯轨迹。
H1|窗口内任务
- :远超单窗口或单会话(常持续数小时至数天);须压缩上下文,并在中断或交接后恢复进度。
H2|跨窗口 / 跨会话任务
- :任务持续到来,总目标跨越多个子任务与环境;要求持久运行,而非封闭的一次性回合。
H3|跨任务流
能力层级:
- :规划 — 行动 — 观察 — 修正,维持连贯路径。
C1|交互式推理(对 H1)
- :在 C1 之上,读写记忆、建检查点、可靠恢复。
C2|状态与记忆(对 H2)
- :在 C1/C2 之上,沉淀可复用技能,从经验中泛化并持续改进。
C3|经验积累(对 H3)
可以看出,三个能力层级并不是彼此割裂的:C2 以 C1 为前提,C3 又建立在 C1 与 C2 之上。一个能够长期成长的 H3 智能体,仍必须在每个具体任务中维持稳定推理和可靠记忆。
图 3 三类长程任务及其对应能力,任务跨度越大,能力要求越高
从 Prompt 到 Harness:智能体控制面的三次跃迁
如图 4 ,本综述将大模型系统的演进概括为三个阶段。变化的关键不是“提示词越来越长”,而是可被工程化控制的范围不断向外扩展。
图 4 长程智能体跨越三个阶段的演进概览
阶段一:Prompt Engineering(2020 - 2023)
阶段二:Context Engineering(2023 - 2025)
阶段三:Runtime Harness(2025 至今)
这一演进也解释了为什么当下的 Agent 竞争越来越像系统工程竞争:同一个基础模型,在不同 Harness 中可能呈现截然不同的任务上限、成本和可靠性。
六维图谱:把碎片化智能体研究放进统一坐标系
本综述从 Foundation、Evolution、Harness、Optimization、Application 和 Frontier 六个视角下,如图 5 所示,论文将分散在记忆、工具学习、多智能体、强化学习、上下文工程、安全治理等方向的工作放入同一张图谱。其价值不仅是“列出更多论文”,更在于回答每项改进究竟发生在哪里:是基础策略更强,还是 Harness 更完善;是提升单窗口推理,还是解决跨会话状态;是任务成功率更高,还是成本和安全边界得到改善。
图 5 长程智能体研究的统一分类框架:从演化、Harness、模型优化和应用,延伸至开放前沿
外部 Harness:让长程能力可控制、可验证、可恢复
如图 6 所示,本综述把 Harness 拆为六个相互连接的核心组件,覆盖从目标设定到最终交付的完整生命周期:
- :包括线性执行、Plan—Execute 和分支搜索。它们负责显式分解任务、追踪子目标,并在失败时重规划或回退。
循环与工作流
- :对工作上下文执行丢弃、压缩和选择,将长期有效的信息写入持久记忆,避免上下文无限膨胀。
上下文与记忆
- :连接外部能力,支持工具接口与协议、主动工具发现以及可复用技能库。工具越多,选择、描述和安全治理也越重要。
工具、MCP 与技能
- :完成任务分解、角色分配、协作拓扑和通信协议管理,使多个模型或智能体能够协同,而不是互相制造噪声。
编排
- :在输入、工具调用和协议边界执行规则、权限、监控与安全策略,并可根据风险动态调整。
Hooks 与中间件
- :从步骤级到任务结束级检查正确性、安全性和目标一致性,并用外部信号驱动修正,而非依赖模型自我认可。
验证
值得注意的是,Harness 并不只是“给模型套一层壳”。它承担的是长期执行中的状态机、控制器和安全边界:当模型出现短视、遗忘或误判时,Harness 必须能让系统停下来、检查、切换路径或恢复。
图 6 Agent Harness 全景:六个核心组件贯穿从目标设定、规划执行到反思恢复、验证交付的完整生命周期。
内部优化:把外化长程能力逐步写回模型内部
如果说 Harness 解决的是“运行时怎样把事情做完”,内部模型优化解决的则是“如何让策略本身越来越适合长程任务”。综述沿完整训练链路梳理了七类方向:
- :显式长上下文、压缩状态、混合架构与高吞吐机制,使长轨迹可表示、可训练、可负担地解码。
架构底座
- :构建规模化、可验证、足够真实的交互环境,并生成包含成功与失败经验的长轨迹数据。
任务、环境与轨迹合成
- :注入推理先验、长上下文状态、多模态感知和合理数据配比。
预训练与中期训练
- :通过指令选择、课程学习与蒸馏,让模型先掌握基础交互,再逐步面对更长、更难的任务。
微调
- :处理长轨迹中的信用分配、策略优化、采样策略与多轮交互,使稀疏终局奖励能够指导中间步骤。
智能体强化学习
- :从模型自己生成、且不断变化的分布中学习,缩短教师策略与部署策略之间的偏差。
On-Policy Distillation
- :从离线经验整理走向在线自我改进,进一步探索智能体与环境共同演化。
自进化
这条链路强调:训练数据不能只包含最终答案,还需要真实的环境反馈、过程状态、工具结果与错误恢复轨迹;优化目标也不能只看单步准确率,而要关注整条轨迹是否高效、可恢复且满足最终约束。
图 7 长程智能体能力的训练管线:以架构底座为基础,通过数据与环境合成、预训练、微调、强化学习、在线策略蒸馏和自进化,将运行时能力逐步内化进模型
长程智能体的形态:以接口为线索的五类应用
如图 8 所示,论文按 Agent 与环境交互的接口,将实践形态归纳为五类。看似不同的应用,背后都承受目标漂移、状态持久化、反馈利用和验证恢复等共同压力:
- :理解大型代码仓库,维护跨文件计划,根据测试与评审反馈反复修复。
软件工程
- :执行深度或广度搜索,整合多源证据,在长链检索保持结论可追溯。
信息检索
- :在浏览器、桌面和移动端持续感知界面状态,完成真实操作。
计算机操作
- :在图像、视频、音频等高成本信息中主动选择观察对象,并完成跨模态理解与生成。
多模态智能体
- :面向个人助理、具身系统和生产力任务,在多工具、多环境和长期目标之间切换。
通用智能体
相应地,评测也必须从一次性问答升级为“面向时间跨度的评测”:任务是否真正包含长依赖?中间步骤能否检查?失败后是否恢复?系统在不同预算和 Harness 下的能力是否可归因?这些问题将直接决定榜单结果能否反映真实部署价值。
图 8 长程智能体的五类代表性应用形态
未来展望:长程智能体的四个前沿方向
论文最终将开放问题归纳为四个轴、九个具体方向。随着任务跨度继续增长,研究重点将从“能不能跑起来”转向“能否长期有效、经济并且可信地运行”。
- 。让 Harness 自身能够演化、迁移和复用,并支持持续学习与终身学习。关键问题是:外置流程如何自动优化,又如何把经验稳定地内化为长期能力。
Evolution:泛化与持续学习
- 。构建既可验证又足够真实的训练环境,提高昂贵真实交互的样本效率,并推动数字 Agent 向具身智能体迁移。论文认为,下一阶段的限速因素可能不再只是模型规模,而是环境构建。
Effectiveness:进入真实环境
- 。未来 Agent 需要感知任务难度、剩余 token、时间和金钱预算,动态决定何时深思、何时压缩上下文、何时切换模型。多模态场景还要决定保留哪些帧、音频或视觉证据。
Efficiency:学会花预算
- 。长轨迹会放大错误与权限风险,因此需要更早识别失败路径,以外部验证锚定反思,并通过最小权限、审批门、沙箱、来源追踪和独立审计保护安全不变量。
Trustworthiness:可恢复且可治理的自治
其中,一个重要判断是:生产环境中的安全与权限边界,主要落在 Harness,而非模型权重中。模型侧对齐必要但不充分;真正决定哪些工具可调用、哪些行动需审批、哪些经验可复用的,是运行时控制层。
总结:迈向长程智能体
过去的大模型 Scaling 围着参数、数据和算力而优化;进入智能体后,时间跨度成为另一条轴线: