ACL | 如何避免LLM生成有毒回复?基于知识编辑的大模型祛毒初探
大模型(LLMs)虽然表现得很强大,但在实际部署中,隐私泄露、偏见输出和恶意滥用这些安全漏洞,一个也没能避免。常见的对齐方法,比如 SFT 和 DPO,能让模型拒绝那些明显有害的请求,比如“哪里可以卖掉偷来的艺术品?”——可一旦遇到精心设计的越狱攻击,这些防线往往就不够用了,正如图1所展示的那样。
▲ 图1 通过知识编辑祛毒
那么,有没有一种更巧妙的方式呢?如果换个思路,不去“教育”模型学会拒绝,而是从根源上动手,精准地修改掉模型内部的“毒性区域”,让它压根儿就不知道怎么输出有害回复,是不是一条路子?知识编辑技术,原本被用来用小数据量精准修改模型对特定事实的认知,直觉上,它在给大模型“祛毒”这个场景下,似乎很有潜力。
基于这个想法,论文团队构建了一个名为SafeEdit的数据集,专门覆盖了9类不安全场景,里面还包含了各种越狱攻击的模板。这个数据集的设计很周到,不管是微调、对齐,还是知识编辑,都能派上用场。在此基础上,团队又提出了一种简单但有效的祛毒基线方法——DINM。它的核心逻辑分两步走:第一步,先找准模型里的“毒性区域”;第二步,只靠一条典型的数据样例,就能把这个区域擦除掉。
更有意思的是,通过深入分析SFT、DPO和DINM这三种方法的祛毒机理,发现了一个十分关键的区别:SFT和DPO可能只是暂时“屏蔽”了毒性区域的激活,而DINM则是实实在在地减轻了毒性参数本身的毒性,相当于进行了一次永久性的削弱,并且还具备一定程度的泛化能力。
祛毒基准
SafeEdit数据集包含了9类不安全场景和48个越狱模板,具体构建流程如图2所示。
这个数据集的设计相当灵活,可以广泛适用于微调、DPO对齐以及知识编辑等多种方法。
▲ 图2 SafeEdit 数据集构建流程
在评价指标上,团队也做了扩展,主要围绕祛毒效果和通用能力两个维度。祛毒效果方面,既有直接的祛毒成功率(DS),也有在OOD数据上的泛化性(DG);通用能力则用来衡量祛毒带来的副作用,比如会不会误伤到无害请求,具体包括了回复流畅性(Fluency)、问答能力(KQA)以及总结能力(Csum)。
方法动机
以往的知识编辑方法大多针对事实知识,它们依赖明确的实体才能工作。但给大模型祛毒,输入往往是多个句子,很难找到明确的实体字符。这怎么解决呢?灵感来自医学上的术中神经电生理监测——在进行手术时,实时监测可能受影响的神经组织,以最大程度避免损伤。把它迁移过来,团队的做法是:先定位LLMs的毒性区域,然后仅用一条数据,精确地对这个区域进行参数修改,如图3所示。
▲ 图3 DINM 方法流程
具体来说,毒性区域是这样定位的:对于一个恶意输入,分别对应安全和不安全两个回复,将这两个回复输入最初的基座模型,追踪它们在前向传播中各层的隐藏状态。二者语义差距最大的那一层,就被认定为“毒性层”,而该层MLP的第二层,就被选为毒性区域。当然,这种定位方式只是一个假说,理论上还存在更优的方法。
实验结果
在知识编辑设定下,实验结果清晰显示了几点结论:
- 知识编辑方法在LLMs祛毒领域展现出了一定潜力。
- DINM在祛毒能力和泛化性上表现优异。
- 知识编辑确实会损害模型的通用能力,但损伤程度相对较小。
- 精准定位,很可能是知识编辑能在祛毒领域取得成效的关键。
机理分析
为了弄清楚DINM和常用的SFT、DPO等方法在内部到底是如何“解毒”的,研究团队做了一系列分析。
(1)性能对比:DINM虽然只用了单条数据(由于不同样本的影响差异较大,这里汇报了标准差),但其祛毒效果已经可以媲美甚至超越DPO。
(2)机理量化:接着,团队量化了经过这三种方法处理后,模型毒性区域的毒性大小,以及流入该区域的信息流。结果如图4所示:SFT和DPO几乎没能改变毒性区域本身的毒性(变化仅为0.49%和0.6%),真正起作用的,是流入该区域的信息流发生了大幅偏移。反观DINM,它并没有去扰动信息流,而是直接让毒性区域的毒性下降了2.72%。
▲ 图4 DINM、SFT、DPO 的祛毒量化
因此,如图5所示,一个合理的猜测是:SFT和DPO可能只是暂时抑制了毒性区域的“激活”;而DINM则是在一定程度上减轻了毒性参数本身的毒性,是一次永久性的削弱。
▲ 图5 DINM、SFT、DPO 的祛毒机理
总结
总的来说,这项工作构建了SafeEdit,一个专门为大模型祛毒而设计的知识编辑基准数据集,并提出了一个简单而有效的基线方法DINM。更重要的是,通过分析不同祛毒模型背后的机制,发现知识编辑技术展现出一种可能:通过擦除有毒区域,从而实现永久性的“解毒”效果。
不足与未来的方向
当然,DINM也有明显的短板。受定位方法的局限,它目前只能擦除部分有毒区域。为了兼顾通用能力,不可能彻底擦除干净,
所以模型依然存在有毒的风险
此外,DINM面临的一个实际问题是,不同样本的选择对编辑效果影响差异很大,
有些样本对模型通用能力影响不小,需要仔细筛选
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名