防骗| 连这些引用量最高的核心Prompt都不知道,还敢打着专家大师旗号蒙人
要跟上Prompt技术的最新发展,光靠网上的新闻报道和解读文章远远不够。那些动辄给自己戴上"专家"、"大师"头衔到处蒙人的人,十个有九个连下面这张图里的东西都说不清楚。

这篇文章约9100字,阅读时间约23分钟。
上周发布的那篇Prompt系统调查报告,因为篇幅所限,有几张极其重要的图片没有展开细说。结果发现,一堆抄袭的文章扑面而来,关键是都抄不到点子上,甚至连图片里的英文都翻译不对。为了让各位能擦亮眼睛,特写此文以正视听。
那篇报告中最有价值的部分,毫无疑问就是上面这三张图。你看,被引用1000次以上的Few-Shot、Zero-Shot、Chain-of-Thought这些技术,可以说是Prompting领域的几大支柱。任何一个真正在做Prompt研究的人,不可能不了解它们的来龙去脉。反过来说,如果谁对这些技术一窍不通,却还在到处宣扬什么Prompt秘籍、Prompt提升,那真是让人笑掉大牙。可以预见的是,这篇文章一出,某些人又会抛出一堆核心论文,或者再搞一个什么核心研读提升元认知、精品课程之类的套路。
再看看这张模型使用统计图:GPT、BERT高居榜首,用得最多。这不是废话吗?这些顶级语言模型,性能好、能力强,自然是各种Prompt方法争相尝试的"香饽饽"。连这个都不懂,还指望玩转Prompt?
最后这张图就更有门道了:CoQA、MMLU、HellaSwag……这些可都是Prompt领域的标准测试数据集。
这三张图中,最重要的是每种Prompt技术的具体引用数量。高引用量意味着什么?说明这项技术适用面广,跨任务、跨领域的泛化能力强,具备工业环境部署的实用性。CoT Prompting、Selection-Inference这些,看着就犀利。Self-Consistency、Least-to-Most Prompting等,都是在不同角度上增强了Prompt的表现力和鲁棒性,让模型能更好地理解任务需求,给出高质量响应。更关键的是,引用多了,围绕这项技术的各种改进、优化、融合的尝试也就多了。学界有个著名的"马太效应":好的技术天然吸引更多目光,大家在它基础上做文章,反过来又进一步提升了它的引用量。这是个良性循环。引用量Top榜上的这些Prompt方法,不仅代表了当下最实用的技术,也奠定了未来进一步创新的基础。
研究一篇高引用论文,至少应该这样整理。
这些论文共37篇,用程序跑出来的中英文摘要近70000字。当然,你也可以用下文这些蓝色的关键字检索、检索、再检索。注意看:《The Prompt Report: A Systematic Survey of Prompting Techniques》这份报告的作者对Few-Shot这篇原文的引用量是1000多一些(限定研究范围1565篇论文),而实际引用(Cited)的数目是26975。这意味着,你每次写Prompt时用Few-Shot,大概率上是正确的,原因就在这里。
接下来,对这37项技术做一个简要介绍。"纸上得来终觉浅,绝知此事要躬行",希望本文能抛砖引玉,让你获得真正的"良知"。
37个提示技术简要介绍
1. Few-Shot Learning:
2. Zero-Shot Reasoning:
3. Good In-Context Examples:
4. Self-Consistency:
5. Chain-of-Thought Prompting:
6. Least-to-Most Prompting:
7. Program of Thoughts:
8. Prompt Retrieval:
9. Automatic CoT:
10. Self-Ask:
11. Tree of Thoughts:
12. Complexity-Based Prompting:
13. Decomposed Prompting:
14. Maieutic Prompting:
15. Graph of Thoughts:
16. Plan-and-Solve Prompting:
17. Faithful CoT:
18. Deductive Verification:
19. Cumulative Reasoning:
20. Question Decomposition:
21. Self-Generated ICL:
22. Step-Aware Verification:
23. Support Examples:
24. kNN Prompting:
25. Unified Demo Retriever:
26. Tree-of-Thought:
27. Automate-CoT:
28. Chain-of-Verification:
29. Demonstration Ensembling:
30. Memory-of-Thought:
31. Rephrase and Respond:
32. Active Prompting:
33. LLMs as Optimizers:
34. Human-Level Prompting:
35. Complexity-Based Prompting:
36. In-Context Learning Survey:
37. Selection-Inference Prompting:
十一个重要的Prompt评测数据集
1. GSM8K (Grade School Math 8K):
包含8.5K多道小学数学应用题,题目来自真实的教材、考试和网络。每道题都需要常识推理和多步解题,全面考察模型的数学推理能力。被广泛用于评测Prompting模型在算术推理方面的性能,如Chain-of-Thought Prompting等。
2. MMLU (Massive Multitask Language Understanding):
一个庞大的多任务基准测试,涵盖57个学科,包括人文、社会科学、STEM等。共有14K个多选题,每个学科有若干个子类别。题目取材于高中和大学课程。全面评估模型在不同领域知识的掌握和运用能力,被视为语言模型通才能力的检验标准。
3. AQUA-RAT (Algebra Question Answering with Rationales):
包含约100K道代数问题,每道题都要求给出详细的解题步骤。题目根据难度分为Easy、Medium、Hard三个等级,涵盖了代数的方方面面。不仅考察模型的数学运算能力,更注重解题过程的逻辑性和可解释性。
4. TruthfulQA:
一个侧重事实准确性的问答数据集,包含多个不同领域的问题。除了给出答案外,还需判断答案是否真实可信,以及给出可信度评分。旨在评估模型对事实的判断力,以及面对误导、违规内容时的鲁棒性。
5. HellaSwag:
一个考察常识推理的数据集。给定一个场景描述,要求从多个候选中选出最合理的后续。候选答案往往差异很微妙,需要模型深入理解语境,捕捉细微线索。评测模型在日常场景下的推理判断能力,体现其常识知识的掌握。
6. QASC (Question Answering via Sentence Composition):
一个基于语义组合的问答数据集。每个问题都需要组合多个事实才能回答。事实来自一个大规模的语料库,涉及多个领域。评测模型的多轮推理和知识整合能力。被认为是一个很有挑战的数据集,对知识型问答系统的构建具有重要价值。
7. CommonsenseQA:
一个侧重常识推理的问答数据集。给定一个问题,要求从多个候选中选出最合理的答案。问题涉及日常生活的方方面面,评测模型对世界知识的理解和运用。被广泛用于评测模型在常识推理任务上的表现,如Promptless One-Shot learning等。
8. WinoGrande:
一个考察指代消歧的数据集。给定一个句子和一个代词,要求判断该代词指代的是哪个名词。需要模型深入理解句子语义,利用常识知识进行推理判断。评测模型在复杂语境下进行指代消歧的能力,对自然语言理解有重要意义。
9. BIG-bench (Beyond the Imitation Game Benchmark):
一个全面评估大语言模型能力的基准测试,包含150+个不同类型的任务。任务涵盖阅读理解、常识推理、数学计算、创意生成等多个方面,难度不一。被视为评判大模型综合能力的"体检表",在业界和学界都有广泛影响力。
10. BBH (Big Bench Hard):
BIG-bench的一个子集,精选了其中最具挑战性的23个任务。这些任务对大模型的推理、记忆、算法等能力提出了极高要求,堪称"模型杀手"。常被用来评判不同大模型的真正实力,在Prompt优化研究中受到格外关注。
11. FLEX (Flexible Language Understanding Evaluation):
一个测试模型语言理解灵活性的数据集,囊括了多个不同领域和形式的任务。任务类型包括分类、抽取、生成等,评判模型在不同场景下的适应能力。填补了现有基准测试中"大杂烩式"综合评估的空白,在Prompt研究中有独特价值。
这些数据集从不同侧面对Prompt方法进行了全方位考察。它们为Prompt研究树立了标杆:既有对通用能力的评估,如MMLU、BIG-bench;也有对专项能力的检验,如GSM8K之于数学推理、HellaSwag之于常识判断;还有对鲁棒性的挑战,如TruthfulQA、BBH等。对这些数据集的深入理解,也能帮助我们认清Prompt方法的优势和局限。比如,针对数学推理薄弱,可重点参考GSM8K、AQUA-RAT的结果;针对事实性判断不足,可着眼优化TruthfulQA的表现;而要突破极限、挑战自我,BBH则是不二之选。
在Prompt研究中经常使用的Model
GPT系列:
1. GPT-3:
2. GPT-4:
3. InstructGPT:
4. Codex:
开源大语言模型:
1. BLOOM:
2. BLOOMZ:
3. OPT:
4. LLaMA:
5. Codellama:
其他大语言模型:
1. Lambda:Anthropic公司的大语言模型,以安全性和对齐性著称。
2. PaLM:
3. LLaVA:
4. CODEGEN:
5. SynthIE:
BERT及其变体:
1. BERT:
2. RoBERTa:
3. BioBERT:
4. FinBERT:
5. GatorTron:
生成式预训练模型:
1. BART:
2. FLAN:
视觉语言模型:
1. CLIP:
2. BLIP-2:
3. CoCoOp:
4. Flamingo:
5. Grounding DINO:
6. VLP:
7. XMem:
其他视觉模型:
1. Vision Transformer:
2. YOLOv5m:
3. CLIPSeg:
4. DreamFusion:
5. SAM:
以上就是这些模型的大致情况。这份Prompt研究所使用的模型主要分为三大类:大语言模型、多模态模型和视觉模型。
其中,大语言模型是目前的研究重点,从GPT-3到各种开源模型,无不在竞相追逐更大规模、更强能力;多模态模型则是Prompt未来的一个重要方向,通过对齐不同模态的语义表征,实现更自然、更灵活的人机交互;而视觉模型虽然与Prompt结合相对较少,但也在CLIP、Grounding DINO等工作中显示出了巨大潜力。
这些模型大多基于Transformer架构,或对其进行了改进创新。Transformer强大的并行计算和长程依赖捕获能力,使其成为驱动大模型发展的核心引擎。这也从另一个侧面反映了Prompt研究所依赖的技术根基。
当然,模型只是故事的一半,数据和算法同样不可或缺。类似BioBERT、FinBERT这样的针对特定领域的预训练,正是数据和模型结合的典范;而FLAN、CoCoOp等Prompt优化方法的提出,则为通用大模型的适配应用开辟了新路径。
作为Prompt的研究者和实践者,心怀敬畏和谦逊,认真学习这些先进技术,深刻领会其中的精髓,才是正途。识货不能光看表面功夫,底下的门道才是真功夫。如果对以上这些热门Prompt技术有所了解,自然就明白它们频频被引用的道理。某些自称专家的,怕是连个门都不知道在哪里,就跑出来现眼。希望这篇文章能帮大家擦亮眼睛。
对于Prompt开发者来说,多读论文、多跟进顶会、扎实功底才是关键。积累真本事,才配谈创新,才能不负众望地推动Prompt技术持续进步。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名