探索大语言模型的不确定性评估
单位 |
研究方向 |
论文标题 |
论文地址 |
代码地址 |
洞见
大语言模型(LLMs)在学术界和工业界已经遍地开花,从问答、摘要到对话、翻译,表现确实亮眼。但话说回来,现在主流的评估平台,基本都在盯着准确率这一项指标。这就像只看考试成绩,却忽略了学生答题时的“犹豫”和“不确定”。那么,模型的准确率高,真的就够了吗?这篇文章给我们提了个醒:不确定性,同样是评估大模型能力时不可绕过的关键维度。
1. 工作动机
为什么非要谈不确定性?因为现有的评估方法确实存在短板——只关注模型的预测结果对不对,却很少关心模型在给出这个结果时到底有多“有把握”。考虑到LLMs已经被用到各种高风险场景中,光看准确率显然是不够的。我们需要一个更全面的评估框架,既能看准不准,也能看稳不稳。
所以,这篇文章提出了一种新的基准测试方法,把不确定性量化整合了进来。具体来说,他们利用了“一致性预测”(Conformal Prediction)这个工具,不只是看模型答对了没有,还要看模型对自己的预测有多大信心。这样一来,评估就不再只是冷冰冰的分数,而是多了一层对模型“自知之明”的考察。通过对多个代表性任务中多个LLMs的实证研究,他们发现了规模、指令微调与不确定性之间的微妙关系,进一步点明了在评估LLMs时考虑不确定性的必要性。
2. 实验方法

文章提出的方法,核心思路是把不确定性量化问题转化为一个统计上的“预测集”问题。他们把五个典型的NLP任务都改造成了多项选择题的形式,并用了三种不同的提示策略来降低模型对提示方式的敏感度。接着,从模型那里拿到每个选项的预测概率,再用Softmax函数转成标准化的概率值。后续,通过一致性预测在校准集上计算出阈值,然后给测试集的每个样本生成一个包含多个候选答案的“预测集”。
在这个过程中,他们用到了两种一致性分数函数:最小歧义集值分类器(LAC)和自适应预测集(APS)。目的很明确——既要保证预测集尽可能包含正确答案,又要准确地反映出模型的不确定性。这种方法在统计上是严谨的,为评估LLMs提供了一个更立体的视角。
3. 实验结果
实验设置
- :将错误率设定为0.1,确保预测集以至少90%的概率包含真实标签。数据集被划分为50%的校准集和50%的测试集。
错误率与数据划分
- :遵循上下文学习(In-Context Learning)的范式,实验中都包含了示例,并对所有任务设定了2048个令牌的最大输入长度限制。
示例和输入长度
- :使用准确率、预测集大小和覆盖率作为核心指标,配合三种不同的提示策略以及两种一致性分数函数(LAC和APS)来量化不确定性。
评估指标与提示策略
实验结果

不确定性与准确性的关系:

模型规模对不确定性的影响:

指令微调对不确定性的影响:
此外,文章还专门探索了MoE(混合专家)技术的影响。结果很不错,采用MoE的LLMs在准确性和不确定性两方面都优于未采用MoE的模型,说明MoE确实能提升模型处理复杂数据的适应能力。另一个有趣的发现是,即使校准数据的比例发生变化,一致性预测方法对不确定性的评估结果依然非常稳定,证明了这个方法相当鲁棒。最后,他们还把一致性预测和传统的困惑度(Perplexity)做了对比。结果很明显:一致性预测在覆盖率和不确定性评估上表现更稳定、更可靠。相比之下,困惑度在不同任务中的覆盖率波动很大,而一致性预测的覆盖率始终能保持在90%以上。这一对比,高下立判。
5. Take Away
这篇文章通过一致性预测方法,对大模型的不确定性做了深入剖析。核心结论可以归纳为几点:LLMs虽然准确率高,但不确定性同样是评估中不可忽视的因素,甚至模型规模变大可能反而带来更高的不确定性;校准数据比例的变化对评估结果影响不大,说明方法很稳健;相比困惑度,一致性预测在不同任务中展现了更稳定的覆盖率和评估能力。这些发现给LLMs的综合评估提供了一个全新的视角,对于未来的研究和实际应用都很有指导意义。
[1] https://arxiv.org/pdf/2401.12794
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名