知识卡片:Claude Code 安全漏洞凸显,蚂蚁开源两大 AI 安全框架
一句话结论
针对 Claude Code 被曝存在安全后门、Agent 行为风险频发的问题,蚂蚁安全开源了 SingGuard-NSFA(智能体安全)和 SingGuard(多模态安全)两大框架,将安全检查前置到执行之前,实现过程可解释与新增风险易扩展。
事件概述或研究问题
- 2026 年 7 月,工信部 NVDB 平台发布风险预警,指出 Claude Code 存在安全后门隐患,可在用户不知情的情况下收集敏感信息;此前 OpenClaw 等 Agent 产品也被曝出高危险漏洞。
- 行业意识到“模型做了什么”(行为安全)比“模型说了什么”(内容安全)更难以防范,传统内容审核体系无法覆盖工具调用、恶意代码生成、提示注入等行为风险。
- 蚂蚁 AI 安全实验室此前已发现多个高危漏洞并协助修复,并与清华大学联合开源了 ClawAegis 全生命周期安全方案,此次开源是向底层安全框架的进一步演进。
方法/产品要点
SingGuard-NSFA(智能体行为安全)
- 核心思路:在智能体执行前进行安全检查,同时拦截请求和兜底响应,防线从文本合规推进到行为安全。
- 风险分类体系:以 CIA 三元组(机密性、完整性、可用性)为理论底座,结合 OWASP 大模型与智能体安全指南,构建 NSFA 风险分类体系。
- 推理模式:
- 生成式:按 NSFA 定义输出链式推理分析,适用于离线合规审计。
- 判别式:每次前向传播直接输出各风险域置信度,延迟低至 45~57ms,适用于实时在线拦截。
- 可扩展设计:骨干网络冻结,外挂轻量分类头;新风险只需补训小头,也可作为插件提升 Llama Guard 3 等模型的 F1 值(+17.6 个百分点)。
- 尺寸:0.8B、2B、4B、9B。
- 评测:在用户请求安全、模型响应安全、跨数据集泛化三大基准上均取得 SOTA;最小 0.8B 模型比肩 8B 竞品,9B 模型泛化 F1 达 91.29%。
SingGuard(多模态大模型安全)
- 核心思路:将安全规则作为运行时输入,不同业务可现场下发各自红线,模型逐条判定是否违规。
- 推理分工:
- 快思考:低延迟秒判。
- 慢思考:逐规则深度推理,通过 early exit 自动切换,平衡效率与准确率。
- 多规则并行优化:提出 RI-Mask 技术,共享图文上下文仅编码一次,多规则并行判断,多模态推理最高提速 5 倍以上。
- 尺寸:0.8B、2B、4B、8B。
- 共同特征:过程可解释(明确触犯哪条规则及依据)、新增风险可扩展(轻量扩展不影响已有能力)。
主要结果或产业意义
- 蚂蚁智能体安全产品已通过信通院泰尔实验室最高等级评级。
- 两大框架开源,为行业提供可复用的底层安全基础设施,标志着 AI 安全从“漏洞修补”转向“安全框架定义”。
- 与既有脉络的关系:此前已有卡片报道 Claude Code 被阿尔伯塔省政府用于漏洞修复(2026-07-07),以及 UST 将 Claude 引入物理 AI(2026-07-09),本卡片聚焦 Claude Code 自身被曝安全漏洞及蚂蚁推出针对性防御框架,是同一技术风险的“攻防两面”增量信息。
为什么重要
- 传统打补丁方式无法应对未知风险和动态变化的安全红线,底层框架才是治本之策。
- 蚂蚁的开源尝试为 Agent 和多模态场景提供了可解释、可扩展的安全方案,有助于建立行业共识的安全基础设施。
- 反映了 AI 安全领域从“内容审核”向“行为管控”的范式转变。
局限与不确定性
- 框架在实际大规模部署中的性能表现、误报率、对复杂业务场景的覆盖能力待进一步验证。
- 蚂蚁开源的框架是否完全兼容主流 Agent 框架(如 Claude Code、OpenClaw 等)?待核实。
- 框架对“未知未知”风险的防御效果仍依赖分类头与规则设计,无法从根本上杜绝所有新类型攻击。
- 文中未披露框架的许可证类型及社区贡献情况,后续维护和更新策略待核实。
可用于图书/PPT/简报的角度
- 角度一:AI Agent 安全为何必须从“补丁”升级为“框架”?结合 Claude Code 漏洞事件和蚂蚁开源方案讲解。
- 角度二:可解释 AI 安全:两个框架如何让“审核过程”可追溯、让“新增风险”可扩展。
- 角度三:中国科技公司在 AI 安全治理中的角色:蚂蚁安全能力从支付风控到 AI 安全的演进路径。
原始材料
- 来源:量子位(QbitAI),《Claude Code砸的坑,蚂蚁安全在尝试填上》,2026-07-13
URL: https://www.qbitai.com/2026/07/448925.html - 英文标题(建议保留的翻译):Claude Code's Pitfalls, Ant Security Tries to Fill Them
- 英文关键词:AI security, Ant Group, SingGuard, SingGuard-NSFA, Claude Code, OpenClaw, agent safety, multimodal safety