AI消息速览

DistScan——利用NMS前预测分布偏移检测目标检测后门

事件日期 2026-08-19 · 学术前沿 · 已接受

事件日期2026-08-19
信息日期2026-08-19
入库日期2026-08-21
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:DistScan——利用NMS前预测分布偏移检测目标检测后门

英文标题: Detecting Backdoors in Object Detection via Pre-NMS Prediction Distribution Shift
英文关键词: backdoor detection; object detection; pre-NMS prediction distribution; scene-level backdoor attacks; DistScan

一句话结论

DistScan 提出一种新的目标检测后门检测思路:即使输入中没有触发器,后门注入也会系统性地改变模型在 NMS 前的预测类别分布,使其偏离训练类别频率;因此只需在干净验证集上统计中间类别预测,即可判断模型是否被植入后门,无需访问模型权重、无需知道触发器、也无需额外训练。

事件概述或研究问题

在安全关键场景中部署的目标检测模型容易受到后门攻击:当隐藏触发器出现时,模型会发生针对性的异常行为。已有检测方法要么依赖触发器反演,要么依赖特定架构假设;更重要的是,代表性已有方法在面对“场景级攻击”时难以可靠泛化。场景级攻击指单个触发器同时诱发场景中所有目标的异常行为。

针对该问题,DistScan 利用一个此前未被充分开发的现象:后门注入会使模型在 NMS 前的预测类别分布发生系统性偏移,即使输入是干净的、没有触发器,也会偏离训练类别频率。

方法/产品要点

  • 核心观察:后门注入导致模型 pre-NMS 预测类别分布偏离训练类别频率。
  • 检测流程:在干净验证集上聚合模型的中间类别预测,得到类别分布;如果该分布显著偏离训练类别频率,则判定模型为被植入后门。
  • 访问需求低:无需模型权重访问、无需触发器知识、无需额外训练。
  • 对比现有方法:不依赖触发器反演,也不依赖特定架构假设。

主要结果或产业意义

  • 实验数据集:MS-COCO 和 PASCAL VOC。
  • 实验范围:两个目标检测架构,三种场景级攻击场景。
  • 效果:相比最佳可用基线,平均检测准确率提升了 27.32 个百分点。
  • 产业意义:为安全关键场景中的目标检测模型提供了一种更易部署的后门筛查手段,尤其适用于难以获取触发器或模型内部权重的场景。

为什么重要

目标检测后门攻击的检测通常面临“触发器未知、权重访问受限”等现实约束。DistScan 只需要干净验证集和训练类别频率,就能绕过这些约束,通过分布偏移信号识别后门模型。这一思路可能为模型安全审计、第三方模型验证、以及供应链场景中的模型筛查提供新工具。

与既有脉络的关系

已有相关卡片分别涉及 ASR 时间戳漂移、户型图生成域偏移和 4D 雷达-相机融合感知,本条不重复上述事实。本条新增的增量信息是:在目标检测后门检测中,NMS 前预测类别分布偏离训练类别频率可作为后门信号,而无需触发器反演或架构假设。

局限与不确定性

  • 摘要未给出两个目标检测架构的具体名称,待核实。
  • 摘要未列出三种场景级攻击场景的具体定义,待核实。
  • 摘要未说明基线方法名称和具体评测指标细节,待核实。
  • “训练类别频率”如何获得、是否总能获得,材料中未展开,待核实。
  • 误报率、对分布漂移的鲁棒性、实际部署成本等未在摘要中说明,待核实。

可用于图书/PPT/简报的角度

  • 后门检测可以不依赖触发器反演,而是利用“干净输入下的分布偏移”作为信号。
  • 目标检测模型在安全关键场景中面临场景级后门攻击威胁。
  • DistScan 代表一种低访问需求的模型审计思路:不需要权重,只需要数据统计。
  • 可作为“AI 安全与模型可信”主题下,关于目标检测后门检测方法的案例。

原始材料

  • 英文标题:Detecting Backdoors in Object Detection via Pre-NMS Prediction Distribution Shift
  • arXiv ID:2608.19088v1
  • 作者:Longtian Wang, Zhengyu Zhao, Chenhao Lin, Le Yang, Shiwei Wang, Yuhan Zhi, Xiaofei Xie, Chao Shen
  • 发布时间:2026-08-19T16:38:39Z
  • 更新日期:2026-08-19T16:38:39Z
  • 主分类:cs.CV
  • 分类:cs.CV, cs.AI
  • 原始来源:https://arxiv.org/abs/2608.19088v1
  • 摘要:Object detection models deployed in safety-critical applications remain vulnerable to backdoor attacks that cause targeted misbehaviors when a hidden trigger is present. Existing detection methods either rely on trigger inversion or exploit architecture-specific assumptions, and critically, representative existing methods fail to generalize reliably to scene-level attacks, where a single trigger induces anomalous behavior across all objects in the scene simultaneously. We present DistScan, a backdoor detection framework based on a simple but previously unexploited observation: backdoor injection systematically shifts a model's pre-NMS prediction class distribution away from its training class frequencies, even on clean inputs without any trigger present. DistScan aggregates intermediate class predictions over a clean validation set and flags a model as backdoored if the resulting distribution deviates significantly from the training class frequencies, requiring no model weight access, no trigger knowledge, and no additional training. Extensive experiments on MS-COCO and PASCAL VOC across two architectures and three scene-level attack scenarios demonstrate that DistScan substantially outperforms existing methods, improving average detection accuracy over the best-performing applicable baseline by 27.32 percentage points.