AI消息速览

ICON分解:用于模型审计的深度表示多变量概念级解释

事件日期 2026-08-26 · 学术前沿 · 已接受

事件日期2026-08-26
信息日期2026-08-26
入库日期2026-08-27
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:ICON分解:用于模型审计的深度表示多变量概念级解释

一句话结论

ICON分解通过在多变量框架中同时考虑所有概念和结果,量化每个概念在控制其他概念后所解释的层方差比例,以避免单概念审计将概念间相关性误认为模型真正使用它们的证据。

事件概述或研究问题

深度神经网络常利用训练数据中的虚假关联进行预测,即“捷径学习”。基于概念的可解释性方法通常逐个测试某个概念(如患者性别或扫描仪设置)能否从网络层中解码,从而筛查模型是否依赖不该用的概念。但这种孤立评估方式可能把概念之间的相关性误判为模型实际使用它们。ICON分解正是为解决这一审计漏洞而提出。

方法要点

  • 核心思想:对深度表征进行多变量概念级分解,估计每个概念在“已考虑所有其他概念和结果变量”之后,能够额外解释的方差比例。
  • 与单概念审计不同,ICON同时纳入全部概念与结果,而非逐一检测。
  • 输出包括:模型真正依赖的概念、由给定概念无法解释的剩余表征,以及稀疏化后的解释。

主要结果或产业意义

  • 在具有已知真实标签的合成数据上,ICON比七种替代基线方法更准确地恢复了概念重要性。
  • 在皮肤病变和脑成像模型上,ICON分离出了模型真正依赖的概念,并量化了未被任何给定概念解释的表征。
  • 通过重训练和分布外测试验证了解释的稀疏性。
  • 潜在应用领域包括医疗影像等高风险场景中的模型审计与合规检查(根据摘要中的实验任务推测,待核实)。

为什么重要

既有工作如ConceptSMILE侧重于审计“基于概念的可解释AI”输出本身的可信度;ICON分解则在概念重要性估计的方法层面直接回应“相关性不等于因果使用”的统计陷阱。它提供了一种更稳健的多变量审计方式,可作为已有概念审计工具的补充或替代基线。

局限与不确定性

  • 方法的具体数学形式、超参数、代码可用性与复现细节未在材料中提供(待核实)。
  • 实验所用数据集的具体规模、来源,以及与七个基线方法的完整对比数值(待核实)。
  • 是否适用于非图像模态(如文本、表格)尚不明确(待核实)。
  • 材料为arXiv预印本,未经同行评议(待核实)。

可用于图书/PPT/简报的角度

  • 从“单概念审计为何可能误判”切入,说明多变量分解的必要性。
  • 将“控制其他概念后仍能解释多少方差”类比为回归分析中的偏解释方差,帮助读者直观理解。
  • 以合成数据验证和医学影像案例作为示例,展示怎样发现模型真正依赖的概念。

原始材料

  • 英文标题:ICON Decomposition: Multivariate Concept-Level Explanations of Deep Representations for Model Auditing
  • 英文关键词(从摘要中提取):Concept-based Explainability; Shortcut Learning; Model Auditing; Deep Representations; ICON Decomposition
  • URL:https://arxiv.org/abs/2608.26083v1
  • Track:academic
  • Topics:foundation-model
  • 说明:正文未能抓取,以上内容仅基于已知摘要元数据生成,细节待核实。