Anthropic 新研究让大模型承认"我不行"
大模型最近又搞了个新动作。那些平时嘴上说“我无所不能”的AI,现在居然开始学会说“这题我不会”了。事情是这样的——一项名为“自我校准提示”的新技术,被Anthropic的研究人员提了出来。说白了,就是给AI装了个“诚实药丸”,让它学会自我审视。

流程其实很简单,核心就两步:先让AI回答一个问题,再让它评价自己刚才答得对不对。就这么两下子,居然能让那些平时嘴硬的大模型乖乖认错。有网友直接说这是“打脸神器”,以后GPT-4再胡说八道,就用这招治它。

这项技术来自于Anthropic的论文,标题就叫《语言模型(大多)知道它们知道什么》。论文作者发现了一个很有意思的规律:模型越大,自我评估的能力越强。这就好比学霸不仅会做题,还能判断自己哪道题做对了、哪道题可能错了。
研究中还有一个挺有意思的小工具叫“P(IK)”,可以理解成一个“知识探测器”,专门用来预测模型到底有没有能力正确回答某个问题。更妙的是,如果你给AI一些提示或者参考资料,它的“P(IK)”值会明显上升。也就是说,给点线索,AI是能临时抱佛脚的。
除此之外,研究人员还发明了一个“头脑风暴”技巧。具体来说,就是让AI在评估自己之前,先看看其他可能的答案或思路。这个方法居然能显著提升它的自我评估准确率。说白了,就是给AI开了个“对比学习”的小灶,让它看看别人怎么答的,再回来看自己答得怎么样,判断反而更准了。
更有意思的一个发现是:随着模型规模的增大,AI的自我验证能力提升得比生成能力还快。换句话说,未来的大模型可能不是变得越来越能“说”,而是越来越懂得“审视自己”说了什么。有网友调侃:以后AI不仅能写作文,还能当阅卷老师了。
其实这项研究揭示了一个很重要的趋势:未来的AI可能不再只是那个全知全能、信口开河的黑盒子,而是一个能理解自身局限、懂得何时该说“不知道”的智能助手。而我想补充的是——连AI都开始学会“自知”了,我们人类是不是也该好好反思一下?
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名