AI消息速览

CNN、Transformer与基础模型时代的类激活映射视觉解释方法综述

事件日期 2026-08-12 · 学术前沿 · 已接受

事件日期2026-08-12
信息日期2026-08-12
入库日期2026-08-14
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:CNN、Transformer与基础模型时代的类激活映射视觉解释方法综述

英文标题与关键词

  • 英文标题:Class Activation Mapping in Explainable Computer Vision: A Method-Centered Review of CNN, Transformer, and Foundation-Model-Era Visual Explanations
  • 英文关键词:Class Activation Mapping; Explainable AI; Visual Explanations; CNN; Transformer; Foundation Models; Review

一句话结论

本文是对2016年以来57篇以方法为中心的类激活映射(CAM)视觉解释文献的系统综述,识别出该领域从单层CNN类别得分解释向对比式、多层、概率化、token感知和基础模型感知解释的总体趋势,同时指出评估协议仍然碎片化。

事件概述或研究问题

  • 研究问题:CAM类方法如何从最早的全局平均池化CNN分类器解释演变为覆盖Transformer、CLIP、DINO、SAM及特征分布比较等基础模型时代的方法?现有方法在归因机制、架构依赖和评估目标上如何分类?各方法贡献和遗留缺口是什么?
  • 综述范围:严格筛选的57篇以方法为中心的论文,时间范围从2016年CAM首次提出至今。
  • 方法覆盖:包括基于梯度的后验解释、无梯度的得分与消融方法、高分辨率上采样、弱监督定位与分割、Transformer token归因、因果与去偏方法,以及使用CLIP/DINO/SAM或特征分布比较的基础模型时代方法。

方法/产品要点

  • 分类法:作者按归因机制、架构依赖和评估目标三个维度划分CAM方法。
  • 评述结构:依次评述基于梯度的CAM、近年/混合CAM风格方法、基于模型或架构感知的方法。
  • 每个方法不仅介绍贡献,还说明它遗留的缺口以及后续方法如何尝试填补。

主要结果或产业意义

  • 主要趋势:从“解释单个CNN低分辨率层中的单一类别得分”转向“对比式、多层、概率化、token感知和基础模型感知的解释”。
  • 评估现状:忠实性、定位、鲁棒性、计算成本、人类信任等各有不同测量协议,评估体系尚未统一。
  • 产业意义:材料未提及具体产业影响;评估协议碎片化会影响跨方法比较,但其实际产业后果待核实。

为什么重要

  • CAM是“可解释人工智能中最广泛使用的视觉解释族之一”,但领域发展迅速且零散。
  • 该综述以方法为中心,系统化梳理了CNN、Transformer和基础模型时代的视觉解释演化,并明确各方法遗留下的问题,为后续研究者选择和改进解释方法提供结构化参考。
  • 在基础模型广泛应用的背景下,本文提供了“如何解释这些模型”的元视角。

局限与不确定性

  • 论文具体目录、分类法细节、57篇论文清单及每篇方法的详细结论均需查阅全文核实(此处仅基于摘要)。
  • 摘要未给出量化比较结果(如哪些方法在特定指标上表现更好),也未给出评估协议碎片化的具体证据。
  • 材料未说明“严格语料”的选择标准;“严格”的具体含义待核实。
  • 产业影响和实际部署效果在摘要中未提及,待核实。

可用于图书/PPT/简报的角度

  • 时间线:2016年CAM诞生到基础模型时代的CLIP/DINO/SAM感知解释,展示“可解释视觉”的进化路径。
  • 分类罗盘:从归因机制、架构依赖、评估目标三维度来鸟瞰CAM家族。
  • 矛盾点:方法日益复杂,评估却依旧碎片化——解释方法本身也需要“解释”。
  • 案例分析:以“从CNN热图到Transformer token归因”为例说明解释粒度从图像区域走向特征/概念。

与既有脉络的关系

  • 无直接延续关系;是在视觉基础模型(CLIP、DINO、SAM)广泛应用的背景下,对解释方法本身的综述。
  • 增量信息:不同于已有卡片关注模型表现或表征,本卡片提供“如何解释这些模型”的元视角。

原始材料

  • 标题(英文):Class Activation Mapping in Explainable Computer Vision: A Method-Centered Review of CNN, Transformer, and Foundation-Model-Era Visual Explanations
  • 作者:AmirHossein Eshghi, Hamid Saadatfar, Seyyed Ali Hoseini, AmirMohsen Eshghi, Siavash Arjomand Bigdel
  • 发表于:2026-08-12(arXiv:2608.12299v1,cs.CV/cs.AI)
  • 来源:https://arxiv.org/abs/2608.12299v1