大模型研究笔记之吴恩达关于大语言模型使用工具的观点及提到的三篇论文
吴恩达最近抛出一个判断:联网搜索这类工具,确实让大语言模型的信息输出能力上了一个台阶,但——工具的潜力还远远没有被榨干。他特别点了代码执行工具、函数调用工具这些方向,认为一旦用好,大语言模型的应用范围会直接扩宽好几个量级。说白了,模型+工具的组合拳,才是未来智能化的真正姿势。

他举了一个很直观的例子:“假设你问——‘如果以7%复利投资100美元,12年后有多少钱?’与其指望Transformer网络直接生成答案(大概率算错),不如让大模型调用代码执行工具,跑一个Python命令:100 * (1+0.07)**12,答案就出来了。大模型可能会输出这样的指令串:{tool: python-interpreter, code: "100 * (1+0.07)**12"}。” 你看,关键不是模型自己算,而是学会调用工具。
顺着这个思路,吴恩达推荐了三篇论文,都是关于大模型如何更好地使用工具。这几篇内容很硬核,对大模型开发者尤其有启发,值得拆开来看看。
1. Gorilla: Large Language Model Connected with Massive APIs
这篇的核心是把LLaMA模型与海量API打通,结果在API调用能力上甚至超过了GPT-4。Gorilla结合了一个文档检索器,能快速适应API文档的实时变化,同时大幅减少了幻觉问题。研究者还专门构建了APIBench数据集来评估这类能力。
关键特点:
应用前景:
2. MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action
这篇提出一种系统范式,把ChatGPT和一群视觉专家模型打通,实现多模态推理与行动。它能处理很多现有视觉模型搞不定的高级视觉任务。设计思路是通过文本提示来表达文本、空间坐标、文件名等,让语言模型直接对接多模态信息。
关键特点:
应用前景:
3. Efficient Tool Use with Chain-of-Abstraction Reasoning
这篇提出了一个叫Chain-of-Abstraction(CoA)的推理方法,让大模型在多步推理中更高效地调用工具。核心是:先让模型解码一条带抽象占位符的推理链,再去调用具体工具补全每个步骤的知识。这种规划抽象链的方式,让模型学到了更通用的推理策略,不太容易被领域知识变动带偏。
关键特点:
应用前景:
总结
这三篇论文从不同角度探索了如何让大语言模型在特定任务上更上一层楼。Gorilla靠深度集成API提升调用准确度;MM-REACT打通ChatGPT和视觉专家,全方位理解多模态输入;CoA推理则在多步推理中实现工具调用效率和准确性的双重飞跃。这些研究不仅推动了大模型技术本身,也给未来落地方案提供了扎实的方向。对AI趋势保持敏锐的开发者,这三篇值得精读。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名