还在死磕AI咒语?北大-百川搞了个自动提示工程系统PAS
北大-百川的PAS:让AI自动调教提示词,效果惊人
大语言模型在各大领域攻城略地,背后离不开一个关键角色——提示词工程。巧用提示词,研究人员和开发者就能让模型在特定任务上发挥得更好,不仅提升性能,还能增强适应性,面对复杂任务更加灵活。更关键的是,相比传统的微调方法,提示词工程几乎不费什么成本就能让模型适配多个下游任务,省时省力。
不过,设计一个有效的提示词对非专业人士来说并不容易,需要大量的学习和实践。直接让大模型自己搞自动提示工程,结果往往不尽如人意——不恰当的提示反而会分散模型注意力,拖累性能。所以,一个能辅助用户、操作简便的自动提示工程系统,就成了刚需。

PAS:突破性的自动提示工程系统
针对这一痛点,北京大学-百川联合实验室带来了PAS自动提示工程系统。它的创新点可以概括为几个关键环节:设计高质量的自动提示数据集、对GPT模型进行少样本学习和数据筛选、自动构建精简而高效的提示数据集,以及通过微调实现有效的自动提示工程。简单来说,PAS能对用户输入进行简洁而有效的补充,实现快速、简单且支持流式显示的自动提示。
结果呢?在多个基准测试中,PAS轻松超越了已有的SOTA模型,而且用的数据量还更少。人工评测也证实了它的实力,潜力巨大。这一成果不仅推动了提示词工程的发展,也为大语言模型在更广泛领域的应用铺平了道路。
- 论文地址:https://arxiv.org/abs/2407.06027
- PKU-Baichuan-MLSystemLab:https://github.com/PKU-Baichuan-MLSystemLab / https://huggingface.co/PKU-Baichuan-MLSystemLab
方法
训练PAS主要分为三步,每一步都很有讲究。
第一步:构建高质量问题数据集
训练PAS,首先得有一份靠谱的问题数据集。研究人员从LMSYS-1M和WildChat两个数据集中,通过三个维度筛选优质问题:
- :利用embedding技术结合聚类算法,把重复数据清理干净。
数据去重
- :借助百川大模型对数据质量进行评估和筛选,确保每一道题都是好题。
质量筛选
- :最终挑选出覆盖10多个类别的9000条高质量问题,确保覆盖面足够广。
多样性保证
第二步:补充提示工程数据
这一阶段,研究人员把内部积累的100条高质量数据和第一步筛选出的问题数据结合起来,通过few-shot learning方法,借助GPT模型来构建自动提示工程数据。具体流程如下:
- :用few-shot learning指导GPT生成初步的提示工程数据。
初始数据生成
- :设计一个Critique步骤,再次利用few-shot learning让GPT评估生成数据的质量。
质量控制
- :自动筛除低质量数据,然后重新生成,经过多轮迭代确保数据质量过关。
迭代优化
- :得到9000条高质量的自动提示工程数据。
最终成果
数据分布
生成的9000条数据的分布情况如上图所示,类别多样,代表性不错。
第三步:微调自动提示模型
最后一步,利用前两个阶段获得的数据集来微调大型语言模型。研究人员选择了Qwen2-7b等模型作为基础模型,用高质量数据集进行定向微调,最终得到一个专门用于自动提示工程的大语言模型。
实验及结果
人工评测
根据人类评估员的测评,相比之前的SOTA模型,PAS在各领域都展现出较高的胜率。多个领域的平均胜率超过50%,胜率与平局率之和更是高达80%以上,表现相当亮眼。
机器评测Benchmark
为了全面评估PAS的性能,研究人员选择了Arena-Hard、Alpaca-Eval 2.0、Alpaca-Eval 2.0 (LC)三个基准测试。随后,他们将PAS应用于六个顶尖的AI模型,包括GPT-4(三个版本)、GPT-3.5、Qwen2-72-Instruct和LLaMA3-70B-Instruct。
评测结果显示:
- 相比无提示情况和之前的SOTA自动提示工程模型,PAS均取得了显著提升。
- 与之前的BPO模型相比,PAS展现出更强的适应性,能与各种超大模型兼容,并且在每个模型上都实现了性能提升。
计算效率分析
PAS不仅性能卓越,计算效率也相当高。在数据效率方面,它仅需9000条微调数据就能展现出卓越性能;在输出效率方面,它能将补充的自动提示长度控制在30个词以内,非常精简。
对于用户体验,PAS的设计也颇为贴心:
- 与BPO等先前模型不同,PAS无需修改用户的原始问题,只进行补充自动提示。
- 响应时间可控,用户体验极佳。
- 支持类似GPT的流式显示,交互体验更上一层楼。
实例:PAS帮助大模型绕开逻辑陷阱
「如果树上有10只鸟,其中一只被射死了,地上有多少只鸟?」
这个看似简单的问题其实暗藏了一个逻辑陷阱——你看到它可能也需要反应几秒,才知道树上还剩9只鸟,而地上只有1只。在没有PAS辅助的情况下,GPT给出了错误的回答。而PAS系统通过补充提示词,显著改善了模型的表现:在PAS的引导下,模型新一轮的回答展现出显著的提升,不仅成功绕开了逻辑陷阱,清晰展示了多步骤的推理过程,还能在给出正确答案之外引导用户理解整个推理过程。这才是自动提示工程该有的样子。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名