首页 > 教程攻略 > ai资讯 >大模型研究笔记之吴恩达关于大语言模型使用工具的观点及提到的三篇论文

大模型研究笔记之吴恩达关于大语言模型使用工具的观点及提到的三篇论文

来源:互联网 时间:2026-07-30 13:07:26

吴恩达最近抛出一个判断:联网搜索这类工具,确实让大语言模型的信息输出能力上了一个台阶,但——工具的潜力还远远没有被榨干。他特别点了代码执行工具、函数调用工具这些方向,认为一旦用好,大语言模型的应用范围会直接扩宽好几个量级。说白了,模型+工具的组合拳,才是未来智能化的真正姿势。

大模型研究笔记之吴恩达关于大语言模型使用工具的观点及提到的三篇论文

他举了一个很直观的例子:“假设你问——‘如果以7%复利投资100美元,12年后有多少钱?’与其指望Transformer网络直接生成答案(大概率算错),不如让大模型调用代码执行工具,跑一个Python命令:100 * (1+0.07)**12,答案就出来了。大模型可能会输出这样的指令串:{tool: python-interpreter, code: "100 * (1+0.07)**12"}。” 你看,关键不是模型自己算,而是学会调用工具。

顺着这个思路,吴恩达推荐了三篇论文,都是关于大模型如何更好地使用工具。这几篇内容很硬核,对大模型开发者尤其有启发,值得拆开来看看。

1. Gorilla: Large Language Model Connected with Massive APIs

这篇的核心是把LLaMA模型与海量API打通,结果在API调用能力上甚至超过了GPT-4。Gorilla结合了一个文档检索器,能快速适应API文档的实时变化,同时大幅减少了幻觉问题。研究者还专门构建了APIBench数据集来评估这类能力。

关键特点:

API调用准确率直接吊打GPT-4,尤其在处理复杂调用时;对文档变化有很强的适应性,不会一换文档就翻车;幻觉问题被显著抑制,比传统prompt方式靠谱得多。

应用前景:

代码、模型、数据和演示都在伯克利大学官网开放。对于那些需要频繁更新API文档的领域,Gorilla提供了全新的可能性——模型不再是死记硬背,而是学会看文档、调工具。

2. MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action

这篇提出一种系统范式,把ChatGPT和一群视觉专家模型打通,实现多模态推理与行动。它能处理很多现有视觉模型搞不定的高级视觉任务。设计思路是通过文本提示来表达文本、空间坐标、文件名等,让语言模型直接对接多模态信息。

关键特点:

支持图像和视频等多模态输入,通过协作视觉专家获得深度理解;零样本实验证明有效,能覆盖多种应用场景;与通过联合微调扩展语言模型的方法做了对比,展示了独特优势。

应用前景:

代码、演示、视频都在项目网站上。它为构建能理解并响应多模态输入的复杂系统铺了一条新路。

3. Efficient Tool Use with Chain-of-Abstraction Reasoning

这篇提出了一个叫Chain-of-Abstraction(CoA)的推理方法,让大模型在多步推理中更高效地调用工具。核心是:先让模型解码一条带抽象占位符的推理链,再去调用具体工具补全每个步骤的知识。这种规划抽象链的方式,让模型学到了更通用的推理策略,不太容易被领域知识变动带偏。

关键特点:

抽象链规划让工具使用计划更高效,推理准确性提升;推理速度比基线工具增强模型平均快约1.4倍;在数学推理和Wiki QA上全面超越传统链式推理和工具增强基线。

应用前景:

验证有效,尤其适合那些需要复杂推理链的问题。为设计高效调用工具的LLM提供了一种新策略。

总结

这三篇论文从不同角度探索了如何让大语言模型在特定任务上更上一层楼。Gorilla靠深度集成API提升调用准确度;MM-REACT打通ChatGPT和视觉专家,全方位理解多模态输入;CoA推理则在多步推理中实现工具调用效率和准确性的双重飞跃。这些研究不仅推动了大模型技术本身,也给未来落地方案提供了扎实的方向。对AI趋势保持敏锐的开发者,这三篇值得精读。