国产AI安全智能体突围全球:86.3%漏洞挖掘成功率背后的技术重构
在人工智能技术飞速演进的当下,大模型的应用边界正从通用的内容生成向高精尖的代码安全领域延伸。近期,深信服公布的AI安全智能体Sangfor AI在CyberGym这一全球高含金量代码安全靶场中的表现,引发了业界的广泛关注。该智能体在基于国产大模型GLM-5.2的固定配置下,面对涵盖ARVO与OSS-Fuzz的1507项严苛漏洞挑战任务,成功完成了1301项,整体成功率高达86.3%。这一成绩不仅使其跻身全球前四,更位列国内参评团队第一,在纯国产技术底座的基础上,实现了对OpenAI、Anthropic等海外AI巨头的成绩超越。这不仅仅是一个榜单排名的变化,更标志着国产AI在复杂代码对抗场景下的实战能力达到了新的工业级标准。
CyberGym评测体系之所以被视为行业标杆,在于其完全脱离了传统的静态理论测试范式,转而贴合工业真实场景。评测以海量开源软件历史高危漏洞为考题,重点考核AI智能体在自主源码分析、多阶段漏洞推演、漏洞复现与PoC验证全链路中的综合能力。这种严苛的评测标准,使得结果具有极高的行业参考价值。在本次测试中,Sangfor AI在细分场景上的表现呈现出高度的均衡性:在ARVO相关任务中成功率达到87.2%,而在更考验系统稳定性的OSS-Fuzz任务中,成功率也达到了77.7%。这一数据有力地验证了国产大模型在处理复杂代码对抗时,不仅具备敏锐的发现能力,更拥有稳定的持续输出能力。
然而,要将模型的语言理解能力转化为可验证的安全能力,并非简单的模型堆叠。深信服技术团队针对漏洞挖掘过程中存在的长链路推理困难、多假设探索迷失以及持续验证缺失等行业痛点,构建了一套独特的“智能体群体(Agent Swarm)协同作战”架构。这套架构的核心在于引入“证据管治”机制,其整体技术框架由四大核心运行逻辑严密支撑,确保了从线索发现到结论输出的每一步都清晰、可信且可追溯。
第一大核心逻辑是“有界探索”。在面对复杂的代码库时,安全调查往往面临多条可能的攻击路径。Sangfor AI并没有采用单一线性的搜索方式,而是围绕不同的安全假设开启独立、边界清晰的调查分支。这种并行推进机制,使得多个可能的解释可以同时被验证,既避免了不同线索之间的互相污染,也防止了某个未经证实的假设在集体共识中悄然固化,从而保证了探索方向的纯粹性。
第二大逻辑为“证据持久化”。在多智能体协作过程中,信息传递的效率至关重要。Sangfor AI摒弃了依赖完整对话历史进行协同的低效方式,转而通过“证据”进行信息交互。无论是已被验证的安全观察,还是已被证伪的错误路径,都会被系统保留并结构化存储。这一机制极大地避免了同一条错误路径被反复重新试错,显著提升了整体搜索空间的收敛速度,让每一次迭代都建立在坚实的历史数据之上。
第三大逻辑是“动态假设裁决”。系统内置了一个智能协调层,它能够基于不断演化的证据状态,实时判断哪些假设仍然成立、哪些问题尚待解决以及哪里还值得投入计算资源。这种动态的裁决机制,使得每一轮探索都成为对搜索空间的有效收窄,避免了资源的无效消耗,确保智能体始终聚焦于高概率的风险点。
第四大逻辑则是“对抗式候选评审”。当证据链逐渐指向某个具体的触发方案时,系统才会构造候选输入并提交“对抗式评审”。这一环节相当于给AI加上了“魔鬼代言人”,评审机制会同时挑战“这次崩溃是否可复现”以及“这次崩溃是否真的对应目标漏洞”。只有真正经受住严密检验的候选,才会成为系统最终提交的安全结论;而未通过评审的候选,则会被打回并用于修正下一步的探索方向。深信服技术团队将这套机制总结为“以假设拓展探索,以证据裁定结论”,通过多层校验,有效压低了误判概率。
技术的突破最终需要服务于实际的生产力提升。深信服表示,相关技术已逐步应用于企业代码安全场景,推动传统静态应用安全测试(SAST)向具备自主推理和业务理解能力的安全Agent升级。传统SAST工具主要依赖规则匹配,虽然在识别SQL注入、命令执行等常见漏洞方面表现稳定,但在面对复杂业务逻辑时往往力不从心。相比之下,新一代安全Agent不仅能够识别常规漏洞,更能深入分析业务逻辑,发现越权访问、认证绕过等传统工具难以覆盖的高级安全风险。
对于广大企业用户而言,AI安全Agent的引入带来的价值远不止于“发现更多漏洞”,更在于其对企业研发流程的重塑。首先,它有效攻克了传统SAST的盲区,全面识别业务逻辑漏洞,大幅拓宽了代码安全覆盖率。其次,凭借AI自动化完成代码理解、跨文件关联分析、攻击路径推理与风险验证,极大地解放了安全专家从事繁重人工劳动力的困境。更重要的是,依靠多阶段推理与严苛的证据验证机制,AI安全Agent显著降低了误报率,使研发人员能够聚焦于真正亟需修复的风险,告别无效的整改循环。
此外,将安全检测前移至研发编写与CI/CD流水线中,实现了“代码提交即自动审计”。这一转变大幅降低了后期返工成本,加速了业务的高效上线。对于企业整体安全能力而言,这意味着在更早阶段筑牢防线,有效遏制因数据泄露、业务中断带来的合规与经济风险。AI安全Agent的核心价值,在于以极高的准确率、极低的人工成本与极快的响应速度,实现了研发效率与代码安全的同步跨越。
展望未来,随着大模型安全技术的持续深耕,安全Agent的能力迭代将成为必然趋势。深信服表示,后续将持续把国际评测验证的前沿技术转化为企业可落地的安全能力,践行“让每个用户的数智化更简单、更安全”的承诺。这一进程不仅关乎单一企业的技术突破,更关乎整个国产AI安全生态体系的完善。在人工智能重塑内容创作与安全防御的双重浪潮中,如何平衡创新与风险,如何构建可信、可控的智能体系统,将是所有参与者必须面对的核心命题。Sangfor AI在CyberGym上的优异表现,为全球AI安全智能体的发展提供了一个极具参考价值的中国方案,也预示着一个由智能体主导的代码安全新时代正在加速到来。