第一本给程序员看的AI Agent图书上市了!
AI Agent火爆到什么程度?
OpenAI创始人奥特曼预测,未来各行各业,每一个人都可以拥有一个AI Agent;比尔·盖茨在2023年曾预言:AI Agent将彻底改变人机交互方式,并碘伏整个软件行业;吴恩达教授在AI Ascent 2024演讲中高赞:AI Agent是一个令人兴奋的趋势,所有从事AI开发的人都应该关注。而国内的科技巨头也纷纷布局AI Agent平台,如钉钉的AI PaaS、百度智能云千帆大模型平台等。Agent被视为未来最重要的智能化工具,对程序员而言,是时候将目光转向大模型的应用开发了。
那么,AI Agent究竟是什么?它如何工作?如何从零开始构建?一本新书《大模型应用开发:动手做 AI Agent》给出了系统性的答案。
AI Agent 面面观
先给Agent下一个定义:Agent是一个具有一定程度自主性的人工智能系统。更进一步说,它是一个能够感知环境、做出决策并采取行动的系统。Agent具有四大特性:
- Agent能够根据自身的知识和经验,独立做出决策和采取行动。
自主性:
- Agent能够学习和适应环境,不断提高自己的能力。
适应性:
- Agent能够与人类进行交互,提供信息和服务。
交互性:
- Agent可以在特定领域内执行特定的任务。
功能性:
要从技术上实现上述特性,Agent通常需要包含四大核心组件:感知器用来收集环境信息;知识库存储和管理有关环境和自身状态的信息;决策引擎分析感知的信息,做出决策;执行器在环境中采取行动。那么,开发Agent时要遵循哪些原则才能收效最佳?本书作者引据儒家经典的“博学之,审问之,慎思之,明辨之,笃行之”,经过引申后阐述了Agent方法论:
- 海纳百川,基于海量数据的训练。
博学:
- 接受清晰明确的指令,即有效的提示工程。
审问:
- 在精巧设计的模式下认知,配置CoT、ToT、ReAct等思维框架。
慎思:
- 明确地遵循人类道德规范,通过指令微调和价值对齐来确保AI安全无害。
明辨:
- 借助ToolCalls和Function Calling等技术工具与外界交互。
笃行:
将传统文化中的哲理与现代科技前沿结合,碰撞出智慧的火花,这对处于萌芽阶段的Agent技术来说,是十分珍贵的思考。Agent市场潜力巨大,但目前相关技术资料分散,本书将多项AI技术和工具整合到一起,为Agent开发提供系统性指导。
本书作者黄佳,笔名咖哥,现任新加坡科技研究局人工智能研究员,在NLP、大模型、AI in MedTech、AI in FinTech等领域积累了丰富的项目经验。他还著有《GPT图解:大模型是怎样构建的》《零基础学机器学习》《数据分析咖哥十话:从思维到实践促进运营增长》等图书。在黄佳的书中,他总是以“咖哥”这个角色引出讨论,再以妙趣横生的方式讲解复杂的技术。他乐于保持好奇心、拥抱变化、持续学习,希望借助AI的“慧眼”和“注意力”来观察世界,并以轻松幽默的方式分享知识。
动手玩转 AI Agent
对于构建Agent来说,目前业界已经具备技术基础,包括大模型和AIGC模型、人工智能应用开发框架和工具、软件平台、丰富的数据等。只要结合具体的业务场景,将现有技术进行整合,就能开发出满足需求的Agent。本书按照“基础知识——技术工具——项目实战”三部分来组织内容,帮助读者从理论学习推进到动手实际操作。
基础知识
这部分先是定义了Agent的概念,然后说明大模型对于Agent的重要程度如同大脑,是Agent进行理解和决策的基础。还对Agent的四大特性与四大核心组件进行介绍。书中提到Agent可用于自动化办公、客户服务、个性化推荐、医疗保健等领域,将会带来新的商业模式和变革。
技术工具
书中介绍了Agent架构的四大要素:规划、记忆、工具、执行。重点介绍了当前流行的ReAct框架。详细说明了以下技术工具的使用方法:
- 用于调用包含GPT-4模型和DALL·E 3模型在内的众多人工智能模型。
OpenAI API以及OpenAI Assistants:
- 开源框架,专门用于构建和开发由大型语言模型驱动的应用程序,其中包含对ReAct框架的封装和实现。
LangChain:
- 开源框架,用于帮助管理和检索非结构化数据,利用大模型的能力和Agent框架来提高文本检索的准确性、效率和智能程度。
LlamaIndex:
Agent通过接口连接大模型,获得生成内容、语言理解、决策支持能力,再通过外部工具执行复杂任务,或者与环境交互。
项目实战
工具都会用之后,这部分讲的是怎样做出成功的应用。书中详细解析了7个项目实战:
- Agent 1:自动化办公项目,通过Assistants API和DALL·E 3模型创作PPT。
- Agent 2:多功能选择的引擎,通过Function Calling调用函数。
- Agent 3:推理与行动的协同,通过LangChain中的ReAct框架实现自动定价。
- Agent 4:计划和执行的解耦,通过LangChain中的Plan-and-Execute实现智能调度库存。
- Agent 5:知识的提取与整合,通过LlamaIndex实现检索增强生成Agent。
- Agent 6:GitHub的网红聚落,AutoGPT、BabyAGI和CAMEL。
- Agent 7:多Agent框架,AutoGen和MetaGPT。
本书兼具理论与实践,读者可以轻松入门,快速掌握AI Agent的开发方法。
结语
自从ChatGPT诞生以来,大模型技术在业界可谓炙手可热,人们从最初的惊叹到现在广泛应用,而人工智能的下一个引爆点很有可能就是AI Agent。《大模型应用开发:动手做 AI Agent》从零基础出发,介绍了Agent的定义、特性与技术架构,还对构建Agent的AI技术工具进行了详细讲解,最后以7个实战项目展示了Agent开发的方法。本书的一大特点是站在技术前沿,结合当下实际需要,提出了一套Agent开发的系统性方法论,这在业界具有开创性意义。实战性强是另一大特点,7个实战项目覆盖了Agent开发的多个方面,读者如果在实际工作中遇到困难,都可以在案例中得到启发,或者直接找到解决方案。
在这本书里,我们又见到咖哥和搭档小雪,在轻松幽默的对话中,将各种原理和概念娓娓道来,生动形象地解释了复杂的技术实现过程。即使是讲前沿的AI技术,读者也会觉得非常有趣。
本书适合想要转型的程序员、意欲投身AI领域的专业研究人员阅读,对Agent技术感兴趣的技术爱好者、企业负责人、高等院校师生也都可以从中有所收获。《大模型应用开发:动手做 AI Agent》为读者提供了一个系统性学习和实践AI Agent开发的绝佳途径。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名