AI消息速览

LaP-Forensics:基于潜-像素一致性引导的多模态推理深度伪造检测

事件日期 2026-07-28 · 学术前沿 · 已接受

事件日期2026-07-28
信息日期2026-07-28
入库日期2026-07-30
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:LaP-Forensics:基于潜-像素一致性引导的多模态推理深度伪造检测

一句话结论

LaP-Forensics 通过冻结的 Stable Diffusion DDIM 反演-重建模型生成残差图,将 RGB 语义与重建一致性证据相结合,在跨生成器检测和伪影定位上达到竞争水平,但自由文本忠实度与后处理鲁棒性仍是开放局限。

事件概述或研究问题

近期生成模型能够产生几乎没有明显视觉伪影的图像,削弱了仅依赖表面外观的检测器及其解释能力。作者提出一个多模态框架,利用基于重建的法医证据来增强仅依靠 RGB 外观的检测。

方法/产品要点

  • 重建参考:使用冻结的 Stable Diffusion DDIM 反演-重建模型提供固定重建参考,残差图用于测量局部与参考的兼容性。
  • 多模态编码:独立的投影仪分别编码 RGB 图像和残差图。
  • 结构化推理:Where-What-Why 模型预测文本分析(文本侧输出)和伪影掩码(空间侧输出)。
  • 训练策略:监督微调后执行 Group Relative Policy Optimization (GRPO),奖励函数结合掩码重叠、输出结构项和证据引用项。文本侧奖励项鼓励模型引用一致性图,但并非自由文本真实性的验证器。
  • 图像级分类:独立的图像级头部融合 RGB 和 DDIM 残差类特征,用于二分类。

主要结果或产业意义

  • 在 UniversalFakeDetect 数据集上展示了跨生成器检测能力。
  • 在官方 SynthScars 基准上获得具有竞争力的伪影定位性能。
  • 控制实验(线索构建、反演步数、组件消融、奖励项消融、反事实分析)支持残差流在评估设置下的效用。

为什么重要

  • 为深度伪造检测提供了新的范式:从依赖表面视觉伪影转向利用生成模型自身的重建不一致性。
  • 结合多模态推理(RGB + 残差)和强化学习(GRPO)来生成可解释的文本分析与伪影掩码,兼顾检测与可解释性。

局限与不确定性

  • 自由文本输出的忠实度(textual faithfulness)未得到验证;文本侧奖励项仅鼓励引用一致性图,并非对生成文本事实性的真实校验。
  • 后处理(如压缩、滤波)下的可靠性尚待研究。
  • 论文未报告在特定后处理或低质量图像上的定量结果(待核实)。
  • 英文关键词:待核实(材料未单独列出,从摘要推断包括 deepfake detection, latent-pixel consistency, multimodal reasoning, GRPO)。

可用于图书/PPT/简报的角度

  • 作为多模态深度伪造检测的前沿案例,强调从“看表面”到“重建一致性”的检测思路转变。
  • 展示如何将冻结的生成模型(Stable Diffusion)作为法医工具,以及与强化学习结合的端到端训练。
  • 与已有卡片(如针对脑微出血或4D雷达的检测)对比,可突出不同领域利用“重建一致性”的共性思路。

原始材料

  • URL: https://arxiv.org/abs/2607.25962v1
  • 英文标题:LaP-Forensics: Latent-Pixel Consistency Guided Multimodal Reasoning for Deepfake Detection
  • 原始来源:arXiv ID 2607.25962v1, Authors: Can Wang, Yuhao Wang, Yushe Cao, Canran Xiao, Fei Shen, Published: 2026-07-28, Category: cs.CV