双开源筑牢AI安全防线:SingGuard如何破解智能体自主执行风险?
随着人工智能技术从单一的内容生成向自主执行任务演进,AI系统的能力边界正在发生深刻重构。当模型不再仅仅被动回答问题,而是开始自主调用工具、执行代码并规划复杂任务时,传统基于内容层面的安全审核体系已显得捉襟见肘。7月13日,蚂蚁AI安全实验室宣布开源两款关键安全模型:面向智能体行为控制的SingGuard-NSFA,以及面向多模态交互内容的SingGuard。这一举措不仅标志着蚂蚁在AI安全领域的系统化布局进一步完善,更揭示了行业对“自主性”带来安全风险的深度关切与应对策略。
从内容安全到行为治理:智能体风险的新维度
在过去的一年中,AI安全领域的威胁形态发生了显著变化。从Amazon Q的提示词投毒事件,到Microsoft Copilot的数据泄露,再到开源智能体框架OpenClaw暴露出的提示词注入风险,一系列案例表明,智能体的自主性越强,其潜在的安全风险放大效应越明显。这些风险已超出传统的内容违规范畴,延伸至行为层面。
智能体在运行过程中可能面临的威胁包括但不限于:恶意代码执行、敏感信息窃取、资源耗尽攻击以及权限滥用等。2025年12月,OWASP发布《智能体应用安全十大风险》,系统性地梳理了智能体特有的安全威胁。紧接着,2026年5月,国家网信办等部门联合印发《智能体规范应用与创新发展实施意见》,从国家层面首次明确了智能体安全治理的要求。
在此背景下,安全防御的重心必须从“说什么”转向“做什么”。SingGuard-NSFA的诞生正是为了应对这一转变,它旨在为智能体装上“实时刹车”,在动作执行前完成安全检测,构建从请求拦截到响应兜底的全链路防护体系。
SingGuard-NSFA:基于CIA原则的行为安全护栏
SingGuard-NSFA的核心设计理念基于CIA三原则,即保密性(Confidentiality)、完整性(Integrity)和可用性(Availability)。这一框架结合OWASP等国际安全指南,将智能体风险细化为7大类、28个中类和185个具体场景。这种细粒度的分类使得安全模型能够精准识别各类隐蔽的风险行为。
该模型构建了一个覆盖133种语言、近10万条样本的智能体安全评测体系,这在当前开源生态中尤为罕见。在实际技术实现上,SingGuard-NSFA兼顾了审计与实时防护的双重需求。它提供两种工作模式:一种是生成详细风险分析报告的模式,适用于事后审查和合规记录;另一种是耗时仅约50毫秒的实时判定模式,适用于线上高并发场景下的快速拦截。
值得注意的是,SingGuard-NSFA提供了0.8B、2B、4B、9B四种模型规模,以适应不同算力环境的部署需求。公开评测显示,其0.8B小模型即可达到8B大模型的性能水平,且支持在新增风险类别时仅训练轻量模块,无需重新训练整个模型。这种模块化训练机制极大地降低了维护成本,提升了安全护栏的迭代效率。
SingGuard:多模态环境下的全能守门员
与行为安全并行的是多模态交互场景下的内容安全。随着大模型对图像、文本及跨模态信息理解能力的提升,传统的关键词识别式安全护栏逐渐失效。今年6月,Anthropic发布的Claude Fable5模型迅速遭遇攻击者利用Unicode字符和西里尔字母替换敏感词绕过安全检测的案例,揭示了多模态安全风险的新特征。
SingGuard专为多模态场景设计,旨在识别隐藏在文字、图片或跨模态信息中的复杂攻击。其最大亮点在于支持运行时动态加载自然语言安全规则。这意味着,当新的攻击手段出现时,运营人员可以通过更新规则而非重新训练模型来应对,这对于规则持续演进且业务流量巨大的生产环境至关重要。
在推理机制上,SingGuard采用“快慢结合”策略。系统首先进行快速初步判断,仅在遇到复杂或模糊场景时启动深度推理。这种机制在保证响应效率的同时,显著提升了检测准确率。
在涵盖文本查询、文本回复、图像、多模态和多语言等6大类评测中,SingGuard在35个数据集及评测切分上的平均F1值均位居榜首。其对比对象包括Llama Guard 3、Google ShieldGemma、GPT-5.1及Gemini 3-Pro等业内主流护栏,SingGuard实现了全面领先,证明了其在多模态安全领域的技术优势。
技术落地与产业实践:从实验室到生产环境
蚂蚁集团此次开源两款模型,并非单纯的技术展示,而是其二十余年安全技术积累的集中体现。依托在支付安全、数据隐私保护和风险治理领域的深厚积淀,蚂蚁将相关能力广泛应用于阿福、AI版支付宝“阿宝”及“AI付”等业务场景。这种“在实战中打磨技术”的模式,确保了开源模型在面对真实复杂业务场景时的鲁棒性。
此外,蚂蚁集团积极参与AI安全标准和治理体系建设。例如,参与制定IIFAA《终端智能体可信互联技术规范》,牵头ITU国际标准立项,并发布智能体安全可信互连协议ASL。这些举措推动了AI安全能力从技术创新向产业实践的转化,旨在构建一个互联互通且可信的智能体生态系统。
中国信通院人工智能研究所安全治理部副主任呼娜英指出,AI安全正从内容审核延伸至行为管控和系统治理,成为智能体规模化应用的基础能力。蚂蚁联合清华大学开源智能体安全防御插件ClawAegis,为自主智能体提供全生命周期防护,正是这一趋势下的典型实践。
结语与展望
AI安全不再是模型发布后的附加项,而是伴随模型设计、训练、部署及运行全过程的核心要素。SingGuard-NSFA和SingGuard的开源,为行业提供了一套可验证、可复用、高效能的安全解决方案。
对于开发者而言,这两大模型降低了构建安全智能体的门槛,使得中小型企业也能获得金融级的安全防护能力。对于监管者和行业组织而言,开源模型提供了透明的技术基准,有助于推动行业安全标准的统一。
未来,随着智能体在更多垂直领域的深入应用,安全威胁的形式将更加多样化。SingGuard系列的后续迭代,以及其与ClawAegis等防御插件的协同演进,将持续为AI生态的健康发展提供坚实保障。在追求技术突破的同时,构建可信、可控、可管的AI安全底座,将是行业走向成熟的必经之路。