AI智能体工作流,突破LLM代际差异,GPT-3.5干出4.0的效果
事件背景
今天一早,朋友圈被吴恩达的一篇文章刷了屏,大意是“AI智能体工作流将超越下一代基础模型”。我特意去翻了原文,发现不少媒体还是老套路,标题党赚眼球。其实吴恩达的核心观点很简单:通过agent workflows(智能体工作流),可以大幅提升大语言模型(LLM)的输出表现。他因此推断,今年构建agent工作流会比砸钱堆基础模型更值得关注——他自己也打算把更多精力投在这件事上。
回到吴恩达的实验数据,就更有意思了。同一项任务,GPT-3.5(零样本)的正确率是48.1%,GPT-4(零样本)好一些,达到67.0%。但注意了,从GPT-3.5到GPT-4的跨越,和叠加迭代智能体工作流的效果相比,简直不值一提——在agent循环中运行时,GPT-3.5的正确率直接飙到95.1%。这揭示了一个关键事实:过去我们总觉得GPT-4会比GPT-3.5强出一个量级,可一旦用上agent workflows,两者的实际表现差距几乎可以忽略。也就是说,面对具体问题,AI的“智商”高低并不能绝对决定最终效果,良好的软件架构同样能显著提升目标成果。
这个认识的意义在于:我们有理由相信,通过应用层面的模式创新和架构设计,同样能高效解决实际问题,而不是非要在基础模型上陷入军备竞赛。这对当前行业格局的冲击不小——包括OpenAI在内的几乎所有厂商都在拼命比拼模型,GPT-4刚出,GPT-5就在路上,其他厂商也在嚷嚷自己的模型比GPT-4更强。但如果基础模型的表现,和通过agent workflow优化后的应用相比,结果可能就没那么亮眼了。这恰恰解释了为什么吴恩达表示今年会更加聚焦智能体工作流。
智能体设计模式
吴恩达在同篇文章中,提出了基于工作流思路的4种智能体设计模式,能够帮助我们利用workflow来优化LLM的表现。四种模式分别是:
- Reflection:让LLM自己审查自己的工作结果,找出改进方向。
- Tool use:给LLM配备工具,比如网络搜索、代码执行、数据处理等,帮助它收集信息、采取行动或处理数据。
- Planning:LLM提出并执行一个多步骤计划来实现目标(比如先写大纲,再在线查资料、写草稿、修改等)。
- Multi-agent collaboration:多个AI智能体协同工作,分解任务、讨论和碰撞想法,产出比单个智能体更优的方案。
坦率地说,前三种模式已经有些“古早”了。业界发展快得很,Reflection、Planning这些方法人工也能操作,Tool use则涵盖了RAG知识库模式。而从当前的发展节奏来看,真正的趋势是第四种——multi-agent模式。这在上一篇内容里已经聊过不少,这里不再重复。目前市面上让人眼前一亮的应用,比如Devin,它本质上不只是一个编程助手,而是覆盖了研发流程中多个角色:任务理解和拆分(像产品经理)、测试(QA)、质量评估、部署上线(DevOps)等等。最终产出的不是零散的代码片段,而是完整的工作流生命周期产物,让人觉得惊艳也就不奇怪了。
从概念上说,multi-agent模式更多是构建AI智能系统的范式,而非单纯的智能体设计模式。当然,如果把一个复杂系统也看作一个智能体,那它就是包含多个内部agent的“大agent”。
多智能体工作流
工作流之所以能有效提升成果质量,本质上是系统论原理在起作用。就像人类社会生产一样,单打独斗的产出有限,但一旦形成组织(比如公司),通过系统化分工和管理,就能实现1+1>2的效果。因此,我认为工作流模式是目前解决实际问题的最佳路径。AI发展也是如此:单点智能的提升,好比人脑智力水平再高,真正干活的还是那些智力一般但足够勤奋努力的个体。所以,未来当我们拥有了足够聪明的LLM底座后,方向一定是以系统论为基础的应用层构建。
以LangGraph为例,它已经是按multi-agent模式设计好的框架。开发者只需要完成以下3件事,就能搭建自己的AI工作流:
- 工具定义
- LLM接入
- 流程定义

工具是最终落到实处、产生实际效果的环节,可以是网络接口、本地软件、硬件驱动等。流程定义部分相对复杂,需要细分任务如何划分职责、如何规划阶段、每个阶段不同角色的分工、达到什么条件、如何执行动作等等。LangGraph在设计上提供了3种模式:
多智能体协同模式
监督人模式
分层次团队模式
从这里可以看出,一方面分工要明确,一个任务最好由一个agent完成,这样更高效;另一方面又要让这些agent协同起来,通过有效的组织、联系和反馈,让整套工作流运作更加顺畅。
结语
读完这篇文章,不难发现一个规律:agents以workflow的模式运行,很可能成为未来AI应用的主流开发模式。在这样的体系下,分工越来越细致,每个agent都可以在某个具体方向上练就独特能力。这也意味着,一套系统中可能需要多个领域小模型或经过微调的LLM。同时,由于分工足够精细,不少agent的功能愈发单一,我们就可以采用能耗更低的技术架构,只在那些需要极高智能的agent上,才动用比GPT-4更强的模型。这反而显得更加“环保”,对当下紧张的芯片和电力资源也是一种缓解。
另一方面,分工越来越细后,自然需要一个“agent市场”,来随时扩展系统能力。当用户在平台上准备完成自己的任务,却又找不到具备相应能力的agent时,可以便捷地从market上载入新的agent。想清楚这一点,就豁然开朗了——吴恩达为什么会把智能体工作流看作今年最重要的课题,答案已经不言自明。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名