知识卡片:MMDiff——多模态模型差异分析用于特征发现与控制
英文标题: Multimodal Model Diffing for Feature Discovery and Control
英文关键词: Multimodal Large Language Models; Sparse Autoencoders; Model Diffing; Interpretability; Feature Steering; AI Safety
一句话结论
MMDiff 是一种多模态模型差异分析框架,通过训练多模态稀疏自编码器(SAE),对比基础语言模型与多模态适配模型,把隐藏状态分解为可解释、可因果操作的特征方向,从而发现、审计和控制多模态大模型行为。
事件概述或研究问题
多模态大语言模型(MLLMs)虽然具备很强的视觉理解能力,但其内部真正导致这些行为的特征很难被识别、审计或控制。已有的 SAE 可以将隐藏状态分解为可解释的特征方向,但主要用于事后的检查,既不容易区分哪些特征是由多模态训练改变的,也不能直接用于目标控制。
MMDiff 试图解决这一问题,将多模态 SAE 转化为特征层面的“接口”,用于发现和控制多模态行为。
方法/产品要点
MMDiff 支持三种用途:
- 特征隔离:通过对比基础语言模型的 SAE 与其多模态适配后的对应版本,找出因多模态训练而发生改变的特征。
- 任务特定特征检测:通过逐 token 对比激活分析,隔离出与目标任务相关的因果特征。
- 特征层面控制:对发现的特征方向进行因果移除或引导(steering),从而影响模型行为。
研究团队为三个多模态大模型家族训练了多模态 SAE:LLaVA-MORE、PaliGemma 2、InternVL3.5。评估任务包括视觉-空间理解、多模态安全和 OCR。
主要结果或产业意义
主要结果包括:
- 移除被发现的稀疏因果特征后,目标行为出现选择性下降:空间任务平均下降 12%,OCR 任务平均下降 17%。
- 在多模态安全攻击上,攻击成功率降低 24%。
- 上述操作对 VQA 性能没有影响。
- 对特征进行引导后,空间准确率平均提升 +3.6%,OCR 准确率平均提升 +1.8%,优于标准的单层引导基线。
产业意义:该结果表明多模态 SAE 不仅是可解释性工具,还可以作为审计、引导和控制 MLLM 行为的机制,服务于更安全、能力更强的模型部署。
为什么重要
MMDiff 把 SAE 从“事后解释”推进到了“事前控制”,使可解释特征可以直接用于模型行为干预。这种“模型差异分析”思路也有助于定位多模态训练带来的特有特征变化,而不仅仅是分析通用语言模型特征。
与已有卡片的关系:本条与已有相关卡片(M⁴World、WordVoice、QANTA 智能体)无直接事实重叠;它们分别涉及驾驶世界模型、TTS 词级控制和任务特定问答智能体。MMDiff 属于模型可解释性与特征控制方向的新增知识卡片。
局限与不确定性
- 论文摘要未提供具体模型规模、SAE 结构、训练数据和超参数细节,待核实。
- 评估所用基准名称、指标口径和基线实现细节,待核实。
- 特征移除和引导在更大规模模型或其他任务上的泛化性,待核实。
- 是否公开代码、模型权重或 SAE 权重,待核实。
可用于图书/PPT/简报的角度
- “模型差异分析”作为可解释性新范式:对比基础模型与多模态适配模型,定位多模态特有特征。
- 从“看见”到“控制”:用稀疏特征直接移除或引导多模态大模型行为。
- 数据亮点:空间任务下降 12%、OCR 下降 17%、安全攻击成功率降低 24%、引导提升 +3.6%/+1.8%。
- 对多模态安全审计和模型对齐的价值。
原始材料
- 英文标题:Multimodal Model Diffing for Feature Discovery and Control
- arXiv ID:2608.09928v1
- 作者:Hunar Batra, Lachin Naghashyar, Ashkan Khakzar, Philip Torr, Christian Schroeder de Witt, Constantin Venhoff, Ronald Clark
- 提交/更新日期:2026-08-10
- 分类:cs.CV; cs.AI; cs.CL; cs.LG
- 摘要链接:https://arxiv.org/abs/2608.09928v1
- PDF 链接:https://arxiv.org/pdf/2608.09928v1