Meta-Rewarding:LLM对齐新技术
今天继续分享一篇上周的热门论文——来自Meta、加州大学和纽约大学共同发表的《Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge》。没热点就发点干货,这篇挺有意思。

背景
传统的大模型偏好对齐,离不开人工标注数据。而self-rewarding机制允许模型自己判断自己的回复质量,从而实现自我提升,不再依赖人工标注。这篇论文的核心贡献是提出了meta-rewarding机制,专门用来解决传统方法容易快速过拟合的问题,从而大幅提升模型的指令遵循能力。
初始状态下,模型已经有一个经过SFT的基础版,但没有监督数据。思路是通过迭代的自我对弈过程,从模型自身生成训练数据。在这个过程中,模型承担三个角色:作为actor,它对给定的prompt生成回复;作为judge,它对自己的回复进行评估和打分;作为meta-judge,它会比较自己判断的质量。
actor是最终需要的模型,但训练效果好不好,取决于judge的判断准不准。判断越准,为actor训练提供的反馈质量就越高,最终才能训练出更好的actor。所以meta-rewarding的目标是在训练过程中同时提升模型作为actor和judge的能力。meta-judge的作用就是提供训练judge所需的反馈信号。
迭代训练方案
- actor数据创建:生成多个response。
- judge数据创建:judge对每个response进行评估并生成评分。
- meta-judge评估:meta-judge比较judge生成的评分,确定哪个更准确。
偏好对数据集
通过meta-judge的评估,就能创建用于训练actor和judge的偏好对数据集。这里面既包括actor生成的response之间的偏好对,也包括judge判断之间的偏好对。
有了偏好数据集之后,使用DPO进行训练。下面给出meta-judge的prompt(翻译版):
效果
Meta-Rewarding方法明显提升了模型遵循指令的能力。以Llama-3-8B-Instruct为例,在AlpacaEval 2上的胜率从22.9%提升到了39.4%。这个提升幅度相当可观。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名