知识卡片:CNN、Transformer与基础模型时代的类激活映射视觉解释方法综述
英文标题与关键词
- 英文标题:Class Activation Mapping in Explainable Computer Vision: A Method-Centered Review of CNN, Transformer, and Foundation-Model-Era Visual Explanations
- 英文关键词:Class Activation Mapping; Explainable AI; Visual Explanations; CNN; Transformer; Foundation Models; Review
一句话结论
本文是对2016年以来57篇以方法为中心的类激活映射(CAM)视觉解释文献的系统综述,识别出该领域从单层CNN类别得分解释向对比式、多层、概率化、token感知和基础模型感知解释的总体趋势,同时指出评估协议仍然碎片化。
事件概述或研究问题
- 研究问题:CAM类方法如何从最早的全局平均池化CNN分类器解释演变为覆盖Transformer、CLIP、DINO、SAM及特征分布比较等基础模型时代的方法?现有方法在归因机制、架构依赖和评估目标上如何分类?各方法贡献和遗留缺口是什么?
- 综述范围:严格筛选的57篇以方法为中心的论文,时间范围从2016年CAM首次提出至今。
- 方法覆盖:包括基于梯度的后验解释、无梯度的得分与消融方法、高分辨率上采样、弱监督定位与分割、Transformer token归因、因果与去偏方法,以及使用CLIP/DINO/SAM或特征分布比较的基础模型时代方法。
方法/产品要点
- 分类法:作者按归因机制、架构依赖和评估目标三个维度划分CAM方法。
- 评述结构:依次评述基于梯度的CAM、近年/混合CAM风格方法、基于模型或架构感知的方法。
- 每个方法不仅介绍贡献,还说明它遗留的缺口以及后续方法如何尝试填补。
主要结果或产业意义
- 主要趋势:从“解释单个CNN低分辨率层中的单一类别得分”转向“对比式、多层、概率化、token感知和基础模型感知的解释”。
- 评估现状:忠实性、定位、鲁棒性、计算成本、人类信任等各有不同测量协议,评估体系尚未统一。
- 产业意义:材料未提及具体产业影响;评估协议碎片化会影响跨方法比较,但其实际产业后果待核实。
为什么重要
- CAM是“可解释人工智能中最广泛使用的视觉解释族之一”,但领域发展迅速且零散。
- 该综述以方法为中心,系统化梳理了CNN、Transformer和基础模型时代的视觉解释演化,并明确各方法遗留下的问题,为后续研究者选择和改进解释方法提供结构化参考。
- 在基础模型广泛应用的背景下,本文提供了“如何解释这些模型”的元视角。
局限与不确定性
- 论文具体目录、分类法细节、57篇论文清单及每篇方法的详细结论均需查阅全文核实(此处仅基于摘要)。
- 摘要未给出量化比较结果(如哪些方法在特定指标上表现更好),也未给出评估协议碎片化的具体证据。
- 材料未说明“严格语料”的选择标准;“严格”的具体含义待核实。
- 产业影响和实际部署效果在摘要中未提及,待核实。
可用于图书/PPT/简报的角度
- 时间线:2016年CAM诞生到基础模型时代的CLIP/DINO/SAM感知解释,展示“可解释视觉”的进化路径。
- 分类罗盘:从归因机制、架构依赖、评估目标三维度来鸟瞰CAM家族。
- 矛盾点:方法日益复杂,评估却依旧碎片化——解释方法本身也需要“解释”。
- 案例分析:以“从CNN热图到Transformer token归因”为例说明解释粒度从图像区域走向特征/概念。
与既有脉络的关系
- 无直接延续关系;是在视觉基础模型(CLIP、DINO、SAM)广泛应用的背景下,对解释方法本身的综述。
- 增量信息:不同于已有卡片关注模型表现或表征,本卡片提供“如何解释这些模型”的元视角。
原始材料
- 标题(英文):Class Activation Mapping in Explainable Computer Vision: A Method-Centered Review of CNN, Transformer, and Foundation-Model-Era Visual Explanations
- 作者:AmirHossein Eshghi, Hamid Saadatfar, Seyyed Ali Hoseini, AmirMohsen Eshghi, Siavash Arjomand Bigdel
- 发表于:2026-08-12(arXiv:2608.12299v1,cs.CV/cs.AI)
- 来源:https://arxiv.org/abs/2608.12299v1