AI大模型奖励优化之开源数据
来源:互联网
时间:2026-08-17 14:25:38
一、前言
在强化学习的棋局里,智能体的每一步行动,都绕不开一个核心的裁判——奖励模型。它就像一套精密的评分系统,决定了智能体如何从与环境的每一次互动中汲取经验,不断优化自己的策略,最终达成预设的目标。可以说,奖励模型的优劣,直接关系到智能体学习的成败。

二、奖励模型实现之开源数据
构建一个有效的奖励模型,通常离不开三个关键环节:数据收集、模型训练,以及至关重要的开源数据基础。接下来,我们就把焦点放在数据源头上,看看业界已经为我们准备了哪些宝贵的“燃料”。
2.1 开源数据
好消息是,针对奖励模型的训练,已经涌现出一些质量相当不错的开源数据集,可以直接取用。目前主流的几个,各具特色,也分别指向不同的任务场景。
先说OpenAI的布局。早在2020年,他们就将RLHF技术应用到了摘要生成任务上,并为此推出了
Summarize from Feedback
对比部分和轴向部分
- 体量较大,约有17.9万条数据。它的标注方式很直接:给定一篇原文和两个生成的摘要,让标注者选出他们认为更好的那一个。
对比部分
- 则包含了1.5万条数据,采用的是Likert量表进行评分,为摘要质量打上一个具体分数。需要注意一点,这两个部分的数据划分并不完全一致,对比部分只有训练集和验证集,而轴向部分则提供了测试集和验证集。
轴向部分
再看
WebGPT
另一个重量级的贡献来自Anthropic团队,即
HH-RLHF(Helpful and Harmless Reinforcement Learning from Human Feedback)数据集
第一部分是关于“有用性”和“无害性”的人类偏好数据
第二部分则是红队测试对话
最后是斯坦福大学开放的
Stanford Human Preferences(SHP)数据集
这里有个很有趣的对比:
SHP和Anthropic的HH-RLHF数据集,其根本差异在于数据来源
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名