首页 > 教程攻略 > ai资讯 >Mistral 推出 Shieldstral:3B 小模型单卡 16GB 跑起多模态审核,号称拿下开源 SOTA

Mistral 推出 Shieldstral:3B 小模型单卡 16GB 跑起多模态审核,号称拿下开源 SOTA

来源:互联网 时间:2026-08-10 14:37:36

Mistral AI 在8月4日丢出一颗"审核核弹"——Shieldstral 内容审核模型,总参数仅3B(30亿),采用开放权重、依照 Apache2.0 许可证发布,已经上线 Hugging Face。它支持12种语言,最诱人的是能在单张16GB GPU 上跑起来。Mistral 放话:它的内容安全性能可以媲美规模大7倍的开放模型,并且在多模态内容审核领域做到了当前最先进水平。

image.png

多数防护模型有个通病:把伤害类别体系直接焊死在权重里,产品一换使用场景,开发者往往得重新训练。Shieldstral 换了个思路——把审核政策写进输入里。操作者可以自己写一道"是或否"的问题,再附上评估场景和严格程度说明,模型随后只从单个输出词元里吐出一个经过校准的安全分数。

image.png

具体机制上,它把每一项审核任务都拆成二元问答,输入由三个带标签字段组成: 说明评估场景与严格程度, 抛出一个"是或否"问题(比如"这段内容是否宣传身体暴力?"), 提供待审内容——可以是提示词、回答、两者组合,也可以是附带可选文本的图像。推理时模型只读取"是"和"否"两个词元的逻辑值,经 softmax 归一化成连续分数,再以0.5为阈值给出二元判断。靠着这套设计,它能一口气覆盖提示词分类、回答审核、拒答检测和毒性检测,把多模态审核塞进了一张消费级显卡的容量里。