长三角实验室发布三大AI安全方案,覆盖大模型、智能体与AIGC治理

0 阅读

三大方案亮相,瞄准AI落地中的真实风险

9月19日,第一届中国网络空间安全大会(CCSC 2026)在安徽合肥召开。其中的人工智能安全与应用治理论坛上,长三角安全人工智能安徽省实验室一口气发布了三套AI安全解决方案——“星界”“星驭”和“星鉴”。它们分别对准当前AI规模化应用中最让人头疼的三个环节:大模型的内容输出是否合规、智能体在运行中会不会失控、以及AIGC生成的内容能否被识别和追溯。

文章配图

这不是概念演示,而是已经跑在真实业务里的产品。据实验室主任刘俊华介绍,这些方案自2023年起就在为讯飞星火大模型提供防护,2025年完成了25个私有化项目部署,到2026年日均调用量已突破数亿次。更关键的是,它们承建了工信部首个AIGC生成检测与处置平台,说明技术路径已被官方认可。

文章配图

星界:给大模型装上“内容安全护栏”

大模型的问题往往出在“嘴上”——它可能输出违法信息、被恶意提示词诱导,或者在训练阶段就埋下偏见。星界的目标就是管住这张“嘴”,而且是从源头管到上线后。

在数据准备阶段,星界会对训练语料做清洗,剔除明显违规或有害的内容;在模型训练时,通过价值对齐技术引导模型输出符合社会规范的回答;模型上线后,则部署实时内容安全护栏,一旦检测到提示词攻击(比如诱导生成诈骗话术)或输出涉黄涉暴内容,系统会立即拦截或打标。

这套方案不是只盯着闭源大模型。它同时支持开源模型接入,也能在公有云或客户私有环境中部署。教育、医疗、汽车等行业的大模型应用,都可以根据自身合规要求配置不同的审核策略。比如医疗场景对隐私敏感,系统会重点识别患者信息泄露;而车载语音助手则更关注指令是否会被恶意篡改。

值得一提的是,安全评测贯穿整个流程。实验室搭建了一站式评测平台,定期用对抗样本、越狱测试等方式检验模型鲁棒性,结果反过来驱动防护策略迭代。这种“测—防—优”闭环,让安全能力能跟上攻击手法的演进。

星驭:防止智能体“乱来”的全周期管控

如果说大模型是“大脑”,那智能体就是能自主行动的“手脚”。但手脚一旦失控,后果可能比说错话更严重——比如擅自调用支付接口、越权访问数据库,甚至执行完全偏离用户意图的任务。

星驭的思路是:先明确“谁在操作”,再控制“能做什么”,最后确保“做了什么可查”。

身份与权限管理是底座。每个智能体在创建时就被赋予明确的身份标识和操作边界,比如只能读取某类数据、仅能调用特定工具。上线前,系统会对智能体依赖的Skill(功能模块)做安全扫描,检查是否存在供应链漏洞;还会把它放进安全靶场,用自动化红队模拟真实攻击,看它会不会被诱导执行危险操作。

运行过程中,星驭监控“输入—规划—执行”全链路。如果用户输入包含恶意指令,系统会在规划阶段就阻断;如果智能体试图调用未授权工具或泄露敏感信息,也会被实时拦截并分级告警。任务结束后,所有操作日志会被完整记录,支持回放和审计,方便事后复盘。

目前这套方案已在智能办公、金融和政务场景试用。比如在企业内部,它可以防止员工通过智能助手导出核心报表;在政务系统中,则确保智能体不会越权查询公民信息。同时,它也支持Skill市场的准入审核——新上架的功能模块必须通过安全检测才能被调用。

星鉴:给AIGC内容打上“可信身份证”

现在的问题不是AI能不能生成内容,而是我们怎么知道一段视频、一张图片是不是AI做的。深度伪造已经能以假乱真,而平台和监管方却缺乏有效的识别和追溯手段。

星鉴的解法是“双管齐下”:一方面主动给合法AI生成的内容嵌入隐式水印或元数据标识,相当于打上数字身份证;另一方面,对来源不明的内容进行AI生成检测,判断它是否由模型合成,并同步识别其中是否包含虚假、违规信息。

这套系统覆盖文本、图像、音频、视频四大模态。比如一段新闻视频,星鉴可以检测人脸是否经过AI换脸,语音是否由TTS合成,同时检查内容是否存在造谣或煽动性言论。如果内容带有官方水印,还能直接追溯到生成平台和时间。

应用场景很明确:AIGC创作工具可以用它自动加标;内容平台能批量筛查用户上传的素材;新闻机构可验证信源真实性;社交平台则能对高传播量的AI内容做风险评级。更重要的是,这些技术为版权保护提供了依据——原创者可以通过水印证明内容归属,平台也能据此处理侵权投诉。

安全不是成本,而是AI落地的前提

刘俊华在演讲中反复强调一点:AI安全治理不再是“可选项”,而是产业规模化应用的“必选项”。没有可靠的安全能力,大模型不敢上线,智能体不敢放权,AIGC内容也无法被信任。

实验室的做法很务实——不空谈理论,而是把技术做成可集成、可部署的产品。比如大模型安全防护平台已支持多个开源模型和央国企行业模型接入;智能体Skill扫描工具直接嵌入开发流程;AIGC检测能力则通过API开放给内容平台调用。

但他也提醒,AI安全风险是动态演进的。今天有效的防护,明天可能就被绕过。因此需要坚持开源开放,让更多研究者和企业参与进来,共同构建生态。比如公开部分评测数据集、共享攻击样本、联合制定水印标准等。

从这次发布的三大方案看,长三角实验室的思路很清晰:安全必须嵌入AI全生命周期,从数据、模型、应用到传播,每个环节都不能掉链子。而真正的护航,不是靠一堵墙挡住所有风险,而是建立一套能持续进化、兼顾安全与可用性的治理体系。

眼下,AI正从“能用”走向“敢用”。谁能把安全做扎实,谁就能在下一阶段赢得信任。这或许正是刘俊华所说的“产业新机遇”——不是卖概念,而是解决真实世界的问题。