DistScan 提出一种新的目标检测后门检测思路:即使输入中没有触发器,后门注入也会系统性地改变模型在 NMS 前的预测类别分布,使其偏离训练类别频率;因此只需在干净验证集上统计中间类别预测,即可判断模型是否被植入后门,无需访问模型权重、无需知道触发器、也无需额外训练。
在安全关键场景中部署的目标检测模型容易受到后门攻击:当隐藏触发器出现时,模型会发生针对性的异常行为。已有检测方法要么依赖触发器反演,要么依赖特定架构假设;更重要的是,代表性已有方法在面对“场景级攻击”时难以可靠泛化。场景级攻击指单个触发器同时诱发场景中所有目标的异常行为。