北大千问团队推出数学专用版CriticGPT,“找茬”让大模型进步更快
北大千问团队推出数学专用版CriticGPT,“找茬”让大模型进步更快
批评是进步的阶梯——这句话放在大模型身上,也同样成立。
OpenAI 之前就用这个思路造了个“找茬模型”CriticGPT。巧的是,就在 CriticGPT 放出前几天,北大联合千问等团队也以类似的思路,设计出了一个“数学专用版”CriticGPT。

在无需额外训练的情况下,这个验证器能在推理时辅助模型,让 GSM8K 上的准确率从 86.6% 提升到 88.2%。
这也是说,在GSM8K数据集上,它可以让模型的准确率从86.6%直接拉到88.2%。
CriticGPT 的核心思路,说白了就是在代码里故意塞些 bug,然后详细标注出来,用这些数据训练一个会 debug 的模型。北大团队发现,这套思路不光在代码里行得通,对解决数学问题同样有效。于是他们把代码换成了数学问题,推出了“数学版 CriticGPT”——
Math-Minos
用GPT-4逐步提修正意见
在数学推理领域,验证解决方案的正确性,是确保推理质量的关键一环。但现有的数学验证器大多依赖二元分类标签来训练,这种方式只能告诉你“对还是错”,解释能力明显不够,没法给验证器提供足够充分的监督信号。
Math-Minos 则打破了这一局限,它引入了
逐步的自然语言反馈
不过,在自然语言反馈的获取上,研究团队一开始也踩了个坑。他们用 GPT-4 生成训练数据,但实验发现,就算是 GPT-4,在逐步评价数学推理任务时也会犯错。为了避免这个问题,团队在提示中引入了
步骤级别的二元分类标签
具体的训练过程分两步走:首先,通过监督式微调,用自然语言反馈数据来提升模型的评估能力;其次,通过标准 ORM(输出奖励模型)和 PRM(过程奖励模型)的训练来实现高效推理。这么做有两个好处。
一是二分类数据和监督微调数据可以解耦。由于监督信号比较稀疏,二分类数据通常远多于监督微调数据,而研究发现,
只需要少量的监督微调数据
二是验证的时候,不需要显式地生成自然语言反馈,这让推理过程更高效。
ORM任务表现明显提升
总体来看,研究人员在训练阶段只加了30K的自然语言反馈数据,就让Mistral-7B验证器的数学能力有了显著提升。在Best-of-256的实验设置下:
ORM设置下,MATH-Minos 将Mistral-7B的准确率在GSM8K数据集从86.2%提升到87.3%,在MATH数据集从35.9%提升到37.4%。
PRM设置下,准确率在GSM8K数据集从87.1%提升到87.6%,在MATH数据集从36.7%提升到37.8%。
在与Self-Consistency结合的设置下,MATH-Minos 将准确率在GSM8K数据集从87.1%提升到88.2%,在MATH数据集从37.8%提升到38.6%。
可以看出,在ORM和PRM任务中,Math-Minos都表现稳定,尤其ORM上的改进更明显。
研究团队还对生成器在步骤级别的错误进行了深入分析,把它们归为五类——无关错误、累积错误、计算错误、逻辑错误和其他错误。结果表明,多步骤推理中错误原因五花八门,模型在各类错误上都可能翻车,这也进一步说明引入自然语言反馈来指导学习是多么必要。
实验发现,在两个数据集上,累积错误(即一个步骤错了,后续步骤基本全跟着错)在所有错误类型中占比最高。不同数据集上的错误分布也有各自的特点:在相对简单的GSM8K上,计算错误更多;在更难的MATH数据集上,逻辑错误才是大头。
团队还构建了元评估集,专门评估验证器在没有生成器影响下独立判断答案的能力。结果显示,Math-Minos在训练中的元评估一致优于传统ORM,收敛更快,判断也更精准。
实验还暗示,Math-Minos 具备很强的Scale Up潜力——数据量大了,效果还能更好。
总的来说,Math-Minos不仅提升了数学验证器的性能,也为自然语言处理领域提供了一套新训练范式。研究团队希望这项工作能启发未来研究,探索自然语言反馈与分类式验证器的潜在整合,推动大模型在复杂推理任务上走得更远。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名