从弱到强的泛化:弱监督激发强大能力(上)
如何控制一个比自己聪明得多的模型?这听起来像科幻设定,但在AI对齐领域,这是即将面临的现实难题。现有的对齐技术,比如基于人类反馈的强化学习,本质上依赖人类来评估模型行为好坏——它管用,但前提是人类的判断始终可靠。问题是,当模型能力超越人类,生成出几十万行的人类看不懂的代码,我们怎么知道模型有没有遵循用户意图?它的回答是否诚实?代码背后有没有安全隐患?
这套逻辑里藏着一个核心矛盾:我们用弱监督者来控制强模型,可是弱监督者可能根本看不懂强模型的某些行为。这就引出了一个被称作“超级对齐”的基础性技术挑战——怎么让一个相对低能的监督者,去真正掌控一个远超自身智能的系统?这个命题过去很难做实证研究,要么停留在理论推演和简化假设里,要么干脆回避掉“模型太强以至于人类看不懂”这个最关键的冲突。
所以我们换了个思路:既然直接研究人类监督超人类模型在现实中很难操作,不如先在一个类比的环境里把它拆开来看。简单说,就是用弱模型来监督强模型。我们在小模型生成的标签上去微调一个大模型,然后观察它能不能“超常发挥”——就像请一位三年级的学生去改十二年级的考卷,看高年级学生能不能自己悟出正确答案。这套框架明确了三个基本步骤:先训练一个弱监督者,然后用弱模型生成的标签去微调一个强模型,最后用真实标签微调强模型作为上限参照。基于这个设定,我们用GPT-4系列模型在NLP基准、国际象棋谜题和ChatGPT奖励建模三个场景里做了大量实验。
结果里有好消息,也有清醒的提示。
第一个核心发现是:强预训练模型确实能够 “超越” 它的弱监督者。哪怕是简单地用GPT-2级别的模型生成的标签去微调GPT-4,它的表现也普遍优于自己的弱老师。比如在NLP任务上,我们通常能缩小两者之间一半左右的性能差距。这个现象我们称之为“从弱到强的泛化”。它之所以发生,很可能是因为强模型本身已经预训练出了很多关于任务的知识,它需要的并不是被重新教授能力,而是被激发。弱监督者给它的是一个不完全的提示,但这个提示能撬动强模型内部已有的能力储备。这是一个相当让人鼓舞的信号。
但第二个发现就没那么乐观了:仅靠弱监督的微调并不够。在ChatGPT奖励建模的任务上,弱到强泛化的效果非常不理想,通常只能恢复两者差距的不到10%。这说明,如果没有其他技术辅助,现有的RLHF框架很可能无法平滑地扩展到超人类模型。这个结论值得所有关心AI安全的人认真对待。
好消息是,第三个发现证明我们可以“做点什么”。我们在标准交叉熵目标函数之外,加上了一个辅助的置信度损失——让强模型在预测时不那么“随波逐流”,即使它的判断与弱标签不一致,也鼓励它自信地坚持自己内部的推理。实验结果显示,配合这个简单的手法,在最小的弱监督者和最大的强模型组合下,中位性能差距恢复率从25%提升到了80%。在很多NLP基准上,我们几乎恢复了强模型的全部能力。
1 引言
当前的模型对齐主要依赖基于人类反馈的强化学习,简而言之就是人类评估者说好的行为就强化,说不好的就打压。这个逻辑在人类能判断的情况下非常有效,指令调优、模型助手的训练都依赖它。但问题是,超人类模型可能展现出人类根本无法理解的复杂行为——比如它用数百万行代码完成了一个架构,但每段代码是否诚实遵循了用户意图?执行起来是否安全?人类没有能力逐一判断。
于是我们面对一个根本性的未知:人类监督在奖励建模和安全分类任务上微调超人类模型时,模型到底会怎么表现?它会泛化出什么样的行为?这个问题很难“现在就做实验”。过去的研究要么只做纯理论推演或简化假设,要么完全回避“超人类”这个因素,只研究人类监督当下模型的情形。
我们想做的事,就是既抓住未来对齐挑战的核心,又能在今天扎扎实实地推进实证研究。所以我们设计了这套类比框架:用小(弱)模型替代人类,用大(强)模型替代超人类模型。看弱模型生成的标签,能否让强模型在微调后真正发挥出自身能力。这其实是在回答一个更本质的问题:弱到强的学习,到底成不成?
直觉上,这事有好的一面,也有坏的一面。坏的一面是,强模型可能直接模仿弱监督者的错误——毕竟训练信号就是照着弱标签走的。好的一面是,强大的预训练模型应该已经有了完成任务的内部表示。一个会写复杂代码的模型,大概率已经“直觉”上知道代码是否忠实遵循指令。所以对齐的核心任务,不是让弱监督者教强模型新能力,更多是激发它已有的知识。正是这个前提让我们相信,弱到强泛化是可能的,甚至可能是某种普遍现象。
我们在三个场景中系统验证了这套设想:NLP基准测试、国际象棋谜题、内部的ChatGPT奖励建模。实验模型覆盖了GPT-4系列从弱到强的不同规模。主要发现可以概括为三条:
- 强模型有能力超越弱监督者:直接用弱模型标签微调强模型,它始终一致性地超越了弱监督者本身。在NLP任务上,用GPT-2级别的标签微调GPT-4,通常能缩小两者一半左右的性能差距。
- 只靠弱监督远远不够:虽然存在积极的泛化,但弱监督下的强模型和用真实标签微调的强模型之间仍有明显差距。ChatGPT奖励建模任务上差距尤其大。这些实验数据指向一个结论:不加额外干预的话,现有的RLHF很难很好地对齐超人类模型。
- 情况可以改善:通过引入辅助的置信度损失、使用中间模型来做引导对齐、以及通过无监督微调优化模型表示,性能可以明显提升。NLP任务上,用GPT-2级别的监督加上辅助置信损失,我们恢复了近80%的性能差距。
当然要说明白,我们的方法远不是最终方案。特别是在奖励建模场景下,距离完全弥合差距还有很长一段路。这套探索更多是概念验证,而不是可以直接部署的解决方案。而且目前的实验设置和真正的超人类模型对齐之间还有很多差异,我们会持续优化基础框架,确保我们的方法论能够沿着正确的方向不断逼近真实问题。
尽管如此——实验结果是相当鼓舞人心的。弱到强泛化不仅可能,而且正在普遍发生。一些非常简单的方法就能明显提升这种泛化效果。如果沿着这个方向取得更大突破,我们或许能用相对较弱的监督,在关键任务上可靠地提取出强模型的知识,从而开发出超人类级别的奖励模型或安全分类器。对齐超人类模型这件事,越来越被认为是全球最紧迫的、尚未解决的技术问题之一。而现在,我们有理由相信,推进它已经不再只是理论推演——我们已经有了反复推敲实证数据的路径。
2 相关工作
弱到强学习本质上是一种特定类型的弱监督学习,类似于用“靠不住的标签”来训练模型。但我们的设置和大多数研究不同点在于:弱标签里面的错误,不是均匀分布的噪声,而是带有“实例依赖性”的——弱模型能理解的一些简单例子就标得好,看不懂的例子上错误率更高。所以处理起来要比普通的噪声问题棘手得多。
这种方法也和师生训练框架有交集。教师先训练,然后在教师生成伪标签上训练学生,这一思路在半监督学习、领域自适应以及知识蒸馏里都是常见的操作。不过常规做法里学生和老师的能力差距通常不大,而且学生往往可以访问真实标签。我们则在故意拉大老师和学生之间的能力鸿沟:比如说让“三年级水平”的去教“十二年级水平”的学生。有意思的是,一些经典方法在这种极端的跨级设置中仍然有效,比如我们使用的置信度辅助损失,其实最早就是由Grandvalet和Bengio在2004年提出的条件熵最小化思想。
另一个值得一提的线索来自预训练与微调的鲁棒性。很多研究已经指出,在足够大规模、多样化数据上预训练的模型,其特征表示的鲁棒性更强,有利于域外泛化。但微调本身会让域内表现变好,域外却不稳定,有时甚至不如零样本提示。解决思路包括权重集成、只微调部分层、或者压制微调对预训练特征的扭曲效应。我们在初步探索中还没有找到这些方案带来明显收益的证据,但未来完全值得深入尝试。
最后,去偏问题也和弱到强泛化直接相关。弱标签里的偏差本质上是弱模型自身能力不足导致的,但这个偏差是“未知”的。这和已知偏差——比如少数群体表现更差——的处理完全不同,因为不知道偏差从哪里来,自然没法依靠手工规则去修正。自动发现和缓解未知偏差的聚类、损失方差缩减、对高损失组进行审计等方法,为我们的问题提供了潜在解决方案。
3 方法
超级对齐的核心问题,用一个更简单的语言来概括就是:一个弱的监督者,到底能不能有效控制一个远超自身的模型?我们把这个问题落到了一个可实证的框架里——用小模型替代弱的人类监督者,用大模型替代未来可能超越人类能力的模型。具体的实验流程只有三步:
- 创建弱监督者:在真实标签上微调一个小型预训练模型,得到“弱性能”基准。然后用这个弱模型在保留集上做预测,生成弱标签。
- 训练强学生:用弱标签去微调一个强大的预训练模型,得到“弱到强性能”。
- 设定上限:用真实标签微调同一个强模型,得到“强上限性能”,这可以理解为“强模型理论上能发挥出的全部能力”。
“弱到强性能”通常会落在弱性能和强上限之间。为了度量效果,我们定义了一个指标——性能差距恢复率(PGR),它衡量弱监督能帮我们“追回”多大程度的差距。完美情况下PGR是1,完全没追上则是0。
这套框架有三个明显的好处。第一,灵活性高,弱模型和强模型可以自由组合,研究缩放规律很方便,不会因为套用最先进模型而让实验成本爆炸。第二,适用范围广,任何感兴趣的任务都可以搬进来测试。第三,有即时实用价值,哪怕最终目标是对齐超人类模型,现在就能用这种方法来评估“用GPT-3级别的监督能否对齐GPT-4”,这对于当前的工作本身就很有意义。
当然也要承认,这套设置和最终的“人类监督超人类模型”还有差异。我们主要关注两个问题。第一是“模仿显著性”:未来的超人类模型可能更倾向于模仿监督者的行为表征,而在我们的实验里,强模型可能并没有学到和弱监督者预测模式直接相关的特征,所以可能会逃过模仿失败模式,弱化难度。第二是“预训练泄露”:当前的预训练数据本身就隐式包含大量人类水平的监督,弱监督者的输出和这些数据有可通约性;但超人级别的知识可能是通过自监督学习获得的,模式不同,诱导方式也可能完全不同。后续我们会持续迭代,不断创造出更贴近真实问题的实验设定。
4 实验结果
我们在三个场景上做了全面评估:NLP基准测试、国际象棋谜题、ChatGPT奖励建模。参与实验的模型选自GPT-4系列,覆盖了极大跨度的计算量差异。整体而言,所有场景、几乎所有规模和组合下,PGR都为正——学生表现始终优于自己的弱老师。
NLP任务上的表现非常亮眼。即使是最弱的监督者和计算量高出数个量级的强模型之间,也总能恢复超过20%的差距。PGR随着弱监督者和学生规模增大而提升,对于最大的学生模型,PGR通常超过50%。
国际象棋谜题上的结果更复杂一些。当监督者特别弱时,PGR接近零,准确率曲线变得很平缓。但一旦监督者的能力提升,PGR快速攀升,在差距较小时可以超过40%。有趣的是,这里PGR并不随学生规模的增大而增加,反而在下降,出现了某种“逆扩展”现象,可能说明这类任务对弱监督信息的传递有特殊限制。
ChatGPT奖励建模场景下的结果最棘手。弱到强泛化表现非常糟糕,我们通常只能恢复约10%的差距,哪怕模型间的计算量差距很小,PGR也几乎没有超过20%。这个结果为我们敲响了警钟:即便是乐观看来充满希望的现象,在某些关键的、决定模型安全性的任务上,仍然严重不够用。光靠弱监督微调,解决不了超人类模型的对齐问题。
引导对齐:多跳胜过一跳
对齐领域一直有个经典想法叫做“引导(Bootstrapping)”:与其一步到位对齐超人类模型,不如先用接近人类水平的模型对齐一个更强的,再用新模型去对齐更智能的,一步步递推。这个想法我们能在自己的实验框架里直接检验。做法很简单:造一系列规模递进的模型M1→M2→…→Mn,先用M1生成标签微调M2,再用M2生成标签去微调M3,依次类推。
我们在国际象棋谜题上进行测试,结果很说明问题。当用直接方法做出大跨度跳跃时,PGR不高;而如果采用多步小跳,每一步保持较高PGR,最终效果显著优于直接一步到位。三轮引导对齐迭代后,准确率曲线从之前的大跳跃先平缓后提升的模式,变成了持续单调上升。不过,这个策略在NLP和奖励建模场景上改善不大,甚至有时候没有作用。从直觉上这也说得通——后两个场景中PGR本身就是随差距增加而持平或上升的,国际象棋里则是下降的,所以引导对齐的价值主要集中在后者。整体来看,引导对齐是一条值得探索的路径,在部分设定下有效,但单靠它还不够。
置信度损失:教学生“自信地反对老师”
直接微调最大的问题在于,强学生被训练去模仿弱老师,可能会把老师的错也学回来。直觉上,我们希望学生能学到老师的“意图”,而不是机械模仿。换句大白话说,即使弱监督者的判断出错了,我们希望强大的学生能根据自己的内部知识自信地做出不同于老师的判断。所以我们引入了辅助的置信度损失,它的思路其实源于半监督学习中经典的条件熵最小化:在标准交叉熵目标之上增加一个额外的损失项,惩罚不自信的预测——即使这种不自信恰恰是因为和学生跟弱老师意见相左。
实验结果再次支持了直觉。在最小的弱监督者和最大的强学生组合下,置信度损失把中位PGR从大约25%提升到了近80%。很多NLP数据集上甚至几乎实现了完美泛化。当然,它在监督者-学生差距不大的情况下帮助有限,甚至在部分数据集上会拖后腿。但拉出整体数据来看——置信度损失显著减少了学生模仿弱老师错误的倾向,也明显减缓了弱标签过拟合。这是目前我们发现的最简单又最有效的改进策略之一。
5 理解
以上是我们初步的发现和实验证据。下一部分,我们会深入探讨这些现象背后的机制,以及它们对于超人类模型对齐意味着什么。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名