知识卡片:工业控制系统异常检测模型对训练期数据污染的鲁棒性
英文标题:Robustness of Anomaly Detection Models for Industrial Control Systems under Training-Time Data Contamination
英文关键词:Anomaly Detection; Industrial Control Systems; Data Contamination; Robustness; Secure Water Treatment (SWaT)
一句话结论
在 SWaT 基准和统一离线评估协议下,11 个异常检测器对训练期数据污染的鲁棒性高度依赖具体模型,且无法仅凭干净数据上的性能进行预测;注入式污染造成的性能退化最严重,而 PCA、SVM、HBOS 和 IForest 相对稳定。
事件概述或研究问题
机器学习异常检测越来越多地用于工业控制系统(ICS),但大多数研究假设检测器的训练数据是可信的。实际中,训练数据可能因日志被篡改、标注错误、历史记录被操纵或不安全的再训练过程而被污染。本文针对这一缺口,评估离线 ICS 异常检测流程在训练期数据污染下的鲁棒性。
方法/产品要点
- 数据集与任务:使用安全水处理(Secure Water Treatment, SWaT)基准。
- 评估对象:11 种异构异常检测器。
- 三种训练期污染策略:
- 随机注入(random injection):将攻击样本随机插入正常训练池。
- 相似性定向注入(similarity-targeted injection):将攻击样本以相似性为目标插入正常训练池。
- 特征噪声注入(feature-noise injection):向选定的正常训练样本添加有界高斯噪声。
- 污染类型:基于污染的注入式攻击,而非梯度驱动的投毒方法。
- 污染预算:从 1% 到 10%。
- 评估协议:使用干净的验证集和测试集,并采用统一的离线评估协议。
主要结果或产业意义
- 鲁棒性具有很强的模型依赖性,不能从干净数据性能直接预测污染下的表现。
- 注入式污染(随机注入、相似性定向注入)导致的性能退化最严重,尤其影响局部密度类和基于距离的检测器。
- 特征噪声污染的相对影响有限。
- PCA、SVM、HBOS 和 IForest 表现相对稳定;经过调优的神经检测器鲁棒性居中。
- 产业意义:强调在机器学习赋能的 ICS 监控中,保证训练数据完整性的重要性。
为什么重要
多数现有工作关注推理阶段的对抗攻击或假设训练数据可信;本文系统性地考察训练阶段数据污染对 ICS 异常检测的影响,为工业安全监控的模型选型和数据治理提供依据。本条卡片补充了在 SWaT 水处理基准上关于训练期污染鲁棒性的评估结果,与已有量子异常检测、视觉语言模型等卡片主题不同,是 ICS 安全方向的新增量。
局限与不确定性
- 评估仅基于 SWaT 单一数据集、所选的 11 个模型和既定的威胁假设。
- 污染方法是基于注入的污染,而非梯度驱动的投毒方法;其他攻击方式下的结论待核实。
- 摘要未列出全部 11 个检测器的名称及详细性能数值,具体模型名单和定量结果需查阅原文(待核实)。
可用于图书/PPT/简报的角度
- 说明工业 AI 系统不能只追求干净数据上的准确率,还需重视训练数据的完整性与污染鲁棒性。
- 可作为 ICS 异常检测模型选型时“鲁棒性优先”的论据。
- 可用于强调数据审计、日志可信度验证和再训练流程安全在工业场景中的必要。
原始材料
- 论文标题:Robustness of Anomaly Detection Models for Industrial Control Systems under Training-Time Data Contamination
- arXiv ID:2608.23547v1
- 作者:Mustafa Umut Ozbek, Taiwo Ojo, Pooria Madani, Khalil El-Khatib, Li Yang
- 发布/更新时间:2026-08-24T17:49:36Z
- 分类:cs.CR; cs.LG
- URL:https://arxiv.org/abs/2608.23547v1