知识卡片:对拒绝的忠实性:神经元选择器的因果审计
一句话结论
通过直接因果审计,发现归因分数在识别语言模型中因果重要的神经元行方面优于传统基线,但高度秩稳定的选择器可能是因果有效性最低的;拒绝行为存在于冗余子空间,不同归因方法通过不相交的行集安装拒绝。
事件概述或研究问题
研究归因分数(attribution scores)能否真实识别出语言模型中因果重要的神经元行(用于剪枝、可解释性、安全编辑)。现有方法缺乏直接因果验证,作者通过两种基于一次性神经元行归零的配对审计来检验。
方法/产品要点
- 采用一次性神经元行归零(one-shot neuron-row zeroing)作为因果干预手段。
- 审计1(语言建模层面):在5个大型语言模型上,比较归因方法、激活基线、幅度基线在识别可丢弃行(dispensable rows)方面的表现。
- 审计2(行为测试):通过有害 vs 良性对比信号驱动干预,检验归因行是否足以安装拒绝行为(针对仇恨和犯罪),同时保持良性拒绝低和语言流畅性,并与层匹配的随机控制对照。
主要结果或产业意义
- 归因方法在识别可丢弃行上显著优于激活和幅度基线。
- 归因行足以安装拒绝行为,且具有特异性(随机控制失败)。
- 高度秩稳定的选择器可能是因果有效性最低的。
- 拒绝存在于冗余子空间:不同归因方法通过大部分不相交的行集安装拒绝,因此恢复的编辑只是充分集的一个实现,而非唯一机制。
为什么重要
- 直接因果审计揭示了秩稳定性等代理指标可能掩盖选择器的失败,为模型编辑、安全微调及可解释性研究提供更可靠的评估方法。
- 对语言模型的安全对齐(如安装拒绝行为)具有直接实践指导意义。
局限与不确定性
- 实验仅针对五种LLM和特定有害类型(仇恨、犯罪),通用性待验证。
- 冗余子空间性质意味着无法确定唯一因果机制,可能影响可解释性的精确性。
- 方法基于单次归零干预,是否适用于更复杂的多次干预或连续编辑?待核实。
- 论文未讨论计算成本或实际部署中的扩展性。
可用于图书/PPT/简报的角度
- 可引述“归因分数不一定反映因果重要性”这一发现,批评仅依赖排名稳定性的评估方式。
- 安全对齐案例:通过归因分数找到关键神经元,实现低副作用的行为编辑。
- 冗余子空间概念:语言模型中拒绝行为由多个独立通路支持,增加模型鲁棒性但也使因果归因复杂化。
原始材料
- 英文标题:Faithfulness to Refusal: A Causal Audit of Neuron Selectors
- 英文关键词:foundation-model(来自Topics字段);分类:cs.CL, cs.ET, cs.LG
- 作者:Ananth Eswar, Pratinav Seth, Utsav Avaiya, Vinay Kumar Sankarapu
- 发布/更新:2026-07-06
- 原始来源:https://arxiv.org/abs/2607.05355v1