首页 > 教程攻略 > ai资讯 >蚂蚁集团连发两款开源安全模型,为大模型与智能体套上“紧箍咒”

蚂蚁集团连发两款开源安全模型,为大模型与智能体套上“紧箍咒”

来源:互联网 时间:2026-07-14 15:08:18
7月13日,蚂蚁AI安全实验室干了一件挺实在的事——正式开源了智能体安全护栏SingGuard-NSFA,同时披露了多模态安全护栏SingGuard的详细情况。这两款模型分别瞄准了当前AI最前沿的两个场景:“自主执行的智能体”和“多模态交互的大模型”。这一步棋,意味着蚂蚁在AI安全领域的体系化布局,又往前推进了一大截。 眼下,AI正从单纯的内容生成走向真正的自主执行。这听起来很酷,但安全问题的复杂度也跟着翻了几倍——不再只是模型输出的好坏,而是蔓延到了行为控制、权限管理、系统治理这些更深层的领域。智能体开始自主调用工具、运行代码、规划多步任务,模型也逐渐能同时理解图像、文本等多种信息。能力边界在拓宽,安全新挑战也在同步冒头。 过去一年,提示词注入、权限滥用、恶意代码执行、数据泄露……这些安全事件就没断过。从Amazon Q被提示词投毒,到Microsoft Copilot的数据泄露,再到开源智能体OpenClaw暴露出提示词注入风险,这些案例都在反复提醒一件事:智能体的自主性越强,安全风险的放大效应就越明显。2025年12月,OWASP发布了《智能体应用安全十大风险》,系统梳理了智能体特有的安全威胁;2026年5月,国家网信办、国家发展改革委、工信部三部门联合印发了《智能体规范应用与创新发展实施意见》,从国家层面对智能体安全治理提出了明确要求。在这样的背景下,蚂蚁AI安全实验室这次开源的模型,目标很清晰——为大模型和智能体提供更完善的底层安全能力。

SingGuard-NSFA:为智能体操作装上“实时刹车”

智能体从“回答问题”进化到“自主办事”,AI开始调用工具、执行代码、编排多步任务,安全风险的重心也从内容层面转移到了行为层面。提示词注入、敏感信息窃取、恶意代码执行、资源耗尽、权限滥用……这些问题,传统的内容审核体系根本覆盖不过来。 针对这个痛点,蚂蚁AI安全实验室拿出了SingGuard-NSFA。它的核心思路是在智能体执行动作之前,完成实时的安全检测。从请求拦截和响应兜底两端,构建起行为安全防护体系。 具体怎么做?SingGuard-NSFA基于CIA原则(保密性、完整性、可用性),结合OWASP等国际安全指南,把智能体的风险细分成了7大类、28个中类和185个具体场景。同时,建立了一个覆盖133种语言、近10万条样本的智能体安全评测体系。技术实现上,它兼顾了安全审计和实时防护两种需求,提供了两种工作模式:一种可以逐条生成详细的风险分析报告,方便事后审查和合规记录;另一种则能在50毫秒左右完成单次风险判定,适合线上高并发场景下的实时拦截。而且,模型提供了0.8B、2B、4B、9B四种规模,可以适配不同的部署需求。 image.png 在覆盖文本查询、文本回复、图像、多模态和多语言的6大类评测中,SingGuard在35个数据集及评测切分上的平均F1均为最高。对比对象包括Llama Guard3、谷歌ShieldGemma、GPT-5.1、Gemini3-Pro等在业内极具代表性的主流护栏,SingGuard均实现了全面领先。 中国信通院人工智能研究所安全治理部副主任呼娜英表示,随着大模型从内容生成迈向自主执行,AI安全正从内容审核延伸至行为管控和系统治理,这已经成为智能体规模化应用的重要基础能力。事实上,蚂蚁AI安全实验室已经针对开源智能体框架OpenClaw开展了专项安全审计,今年4月还联合清华大学开源了智能体安全防御插件ClawAegis,为自主智能体提供覆盖全生命周期的安全防护。这次SingGuard-NSFA与SingGuard多模态安全护栏相继开源,是蚂蚁集团持续推进AI安全技术研发和开放生态建设的重要一步。 这些安全技术的研发与开源,背后是蚂蚁集团二十余年的安全技术积累。依托在支付安全、数据安全、隐私保护和风险治理等领域的长期实践,蚂蚁持续完善AI安全体系,相关能力已经落地在蚂蚁阿福、AI版支付宝“阿宝”、支付宝“AI付”等业务场景中。 与此同时,蚂蚁集团还在持续参与AI安全标准和治理体系建设——参与了IIFAA《终端智能体可信互联技术规范》的制定,牵头了ITU国际标准《终端智能体可信互联技术规范》的立项,并发布了智能体安全可信互连协议ASL。从技术创新到产业实践,这条路正在越走越宽。