首页 > 教程攻略 > ai资讯 >自动化设计agent系统

自动化设计agent系统

来源:互联网 时间:2026-08-26 13:54:05

近年来,随着基础模型的能力不断攀升,研究者们投入了大量精力去构建更强大的通用智能体系统——思维链、自我反思、工具调用,各种高级模块被嵌入其中,试图让AI在复杂任务上表现得更可靠。但你有没有想过一个问题:这些设计,全是靠手工打磨出来的。而历史经验早已反复告诉我们,手工设计的巧思,最终往往会被学习到的方案超越。这不是巧合,而是技术发展的必然路径。

工作模式、设计习惯、直觉经验,这些东西在机器学习的世界里总会被一步步取代。早期计算机视觉中,HOG等手工特征最终被卷积神经网络自动学到的特征碾压;在大语言模型的对齐领域,DPO这类自动学习损失函数的方案,已经全面超越了手动设计的策略。沿着这个逻辑,一个很自然的疑问就冒出来了:能不能让这个过程也发生在智能体系统的设计上?换句话说,能否让智能体自己去发明智能体?

这引出了一个新方向——

自动化设计智能体系统

(Automated Design of Agentic Systems,ADAS)。通俗点说,就是让机器学会自己去发现更好的系统结构、构建模块乃至组合方式,把“调参设计”这种苦活彻底交给算法,而且极有可能比人类做得更快、更好。

今天就先聊聊这篇来自论文《Automated Design of Agentic Systems》的工作,它不光是提出了ADAS这个概念,还给出了一个真正可落地的做法——在代码空间中搜索,让元智能体(Meta Agent)像一个迭代进化的程序员一样,自动编写出新的智能体系统。这是一种几乎全覆盖的创新思路:只要编程语言是图灵完备的,任何可能的智能体系统——包括新颖的提示策略、工具使用流程、控制结构及其排列组合——理论上都能被发现。

听起来很科幻?结果更炸裂。提出的

元智能体搜索(Meta Agent Search)

,在多个高难度基准上,将最先进的手工设计智能体打出了差距:DROP阅读理解任务的F1分数提升了13.6/100,MGSM数学任务准确率跃升14.4%。更令人兴奋的是,这种发现的智能体不仅能跨相似领域迁移,甚至从数学领域迁移到阅读理解领域,依然保持了肉眼可见的优势。GSM8K上准确率大涨25.9%,GSM-Hard也提升了13.2%。这已经不是优化微调的水平,而是从根本上发现了一种更有潜力的设计范式。

这么强的效果,关键在哪?我们仔细看看。

什么是ADAS:一个新兴的研究范式

首先要明确一点:社区对智能体的定义尚未完全统一,但这篇论文所说的智能体,是指那些以基础模型为核心模块、通过规划、调用工具、执行迭代步骤来解决问题的系统。而ADAS的目标,就是让自动化算法自己去探索、创造这样的系统。

ADAS算法有三个核心组成部分:

  • 搜索空间

    ,决定了可以表达哪些智能体系统。以往的工作(如PromptBreeder)大多局限在调整文本提示,控制流程等固定结构很难突破;而在代码空间内搜索,理论上可以穷尽任意可能的构建模块与组合方式。
  • 搜索算法

    ,控制如何探索这个巨大的、甚至无界的搜索空间。在探索与利用之间寻找平衡,是一个关键设计变量。
  • 评估函数

    ,决定了以什么标准(性能、成本、延迟或安全性)来评价候选智能体。

很多已有工作确实可以视作ADAS的早期雏形,但它们的搜索空间都过于狭窄。论文敏锐地指出:比较有前景、但目前还很空白的,是直接把整个智能体系统用代码定义出来,然后让元智能体在代码层面去搜索和优化。为什么说这是最值得探索的方向?主要有三点:

  • 编程语言具备通用性和完备性,理论上可以表示任意复杂的智能体设计;
  • 代码具有天然的可解释性,人类能够查看、理解、调试,这对安全性和可控性非常关键;
  • 可以站在现有开源框架(如LangChain)的肩膀上,把已有的良好模块直接作为搜索起点。

核心算法:Meta Agent Search

接下来看具体算法。Meta Agent Search的设计并不花哨,但很巧妙。核心思路就是:用一个元智能体(采用基础模型担任),基于不断积累的已发现智能体档案,去迭代地编写出新的智能体“前向函数”。这个函数接收任务信息,输出智能体的最终响应。

在实际操作中,论文提供了一个不超过100行的框架模板,为元智能体提供了查询FM、格式化提示等基本功能。元智能体不需要从头构建一切——它只需要发明那个决定“怎么做”的逻辑流程。这也让代码层面的创意空间被彻底打开。

元智能体在每次迭代中,会尝试生成一个新的智能体程序,然后基于验证数据计算其性能(如准确率或F1分数),并附上95% bootstrap置信区间。生成的智能体和评估结果都会被收进档案中,推动下一轮的探索。这听起来像是经典的迭代进化,但关键是“有趣性”——算法鼓励元智能体去探索那些新鲜而有价值的点子,而不是简单复现已有的高水平智能体。过程中还有自我反思的加入:新颖性和正确性会被反复打磨两轮,出现代码运行错误的还可以再修三轮。

正是这种基于“脚手架”不断创新的方式,让有趣的突破不再是偶然,而是必然。

实验效果:学习型智能体全面压制手工设计

论文的实验涵盖了多个极具挑战性的领域:ARC逻辑谜题、DROP阅读理解、MGSM数学、MMLU多任务、GPQA科学难题。所有实验都指向一个结论:无论在哪个任务上,Meta Agent Search发现的智能体都明显强于最先进的手工设计。尤其是在DROP和MGSM上的大幅提升,已经很难用“调参优化”来解释——这更像是在设计模式上找到了质变。

最让人感兴趣的是ARC挑战部分。ARC任务的难点在于每个问题都有独特的转换规则,AI必须从寥寥几个示例中迅速学会抽象的规则,再用代码形式写出转换逻辑。这是一个公认的困难领域。但元智能体搜索从第3次迭代就涌现出了一个重要的设计模式:用多个思维链生成候选答案,再进行细化和集成,最终取最优。这个模式后来成了后续创新的重要垫脚石。

更酷的是,最终的复杂反馈机制并不是凭空出现的。迭代5、11、12中分别出现了“整合多样反馈”、“针对特定特质(如效率、简单性)进行评估”、“模拟人类式反馈”这些想法,最终在迭代中融合成了我们现在看到的高性能智能体。这种“交叉组合式创新”,像是框架层面的演化,让人对自动发现新设计模式的潜力感到震撼。

可迁移性与泛化能力:不只是单任务的冠军

一个智能体在单个任务上强,可能只是过拟合;但如果能在不同模型、不同领域之间依然表现出色,那就说明其设计模式具有真正意义上的通用性。

论文中,把从GPT-3.5上找到的ARC最优智能体迁移到了Claude-Haiku、GPT-4和Claude-Sonnet上,结果全线上涨,而且在Claude-Sonnet上甚至冲出接近50%的准确率——这比任何手工设计的基线都强出整整一个档次。

跨领域迁移也毫不逊色。在MGSM数学任务上搜索出来的智能体,迁移到GSM8K、GSM-Hard、SVAMP、ASDiv等数学任务后,几乎都实现了两位数的准确率提升。更意外的是,这些智能体即便迁移到非数学任务(如阅读理解、多任务推理),表现也能匹配甚至超越那些为这些领域专门设计的手工智能体。系统发现的似乎不是针对某个任务的“花招”,而是一种更扎实、更具适应性的智能体结构。

这其实呼应了论文的核心判断:手工设计在速度、深度和可创造性上,注定无法与自动化学习相抗衡。ADAS不是替代人类研究者的工具,而是为探索未知的智能体设计空间开辟了一条更高效、更具突破可能的道路。可以预见,未来会有越来越多的智能体系统不再是“设计出来”的,而是“进化出来”的。这也意味着,下一波AI能力的飞跃,很可能不是由某个精巧的新提示词带来的,而是由自动化的设计引擎在不断迭代中悄然实现的。