AI消息速览

InstructMixup: Instruction-Guided Salient Patch Editing for Robust Data Augmentation

事件日期 2026-07-21 · 学术前沿 · 已接受

事件日期2026-07-21
信息日期2026-07-21
入库日期2026-07-22
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:InstructMixup: Instruction-Guided Salient Patch Editing for Robust Data Augmentation

英文标题:InstructMixup: Instruction-Guided Salient Patch Editing for Robust Data Augmentation
英文关键词:Data Augmentation, Mixup, Salient Patch Editing, Instruction-Guided Generative Model, Fractal Structure, Vicinal Risk, Robustness

一句话结论

InstructMixup 是一种仅在单个样本内部进行数据增强的方法——通过指令引导生成模型编辑显著补丁并注入分形结构,在不跨样本混合的前提下构造具有挑战性且标签一致的训练样本,在多个视觉骨干和基准上全面超越现有混合方法。

事件概述或研究问题

  • 背景:基于混合(mixup)的数据增强是当前视觉模型提升泛化性的主流方法,但计算信息性混合区域开销大,且不同图像内容的混合常破坏语义完整性。
  • 问题:能否在设计数据增强时避免跨样本混合,同时保留混合策略的挑战性与多样性?
  • 本文方案:InstructMixup 所有操作限制在单个样本内:先提取多尺度显著补丁,再用指令引导生成模型编辑该补丁,最后将编辑后的补丁融合回同一样本的非显著区域;此外还向显著区域自适应注入自相似分形结构,最终样本同时包含分形与非分形结构。

方法/产品要点

  1. 单样本内增强流水线
    • 轻量显著性检测器提取多尺度显著补丁。
    • 指令引导生成模型(如 InstructPix2Pix 风格)对补丁进行编辑(离线计算并缓存,训练成本可忽略)。
    • 编辑后的补丁混合回原图的非显著区域。
  2. 分形结构注入:以自适应比例向同一显著区域注入自相似分形,增加表示多样性。
  3. 理论分析:推导邻域风险的二阶近似,证明该方法同时强制执行对生成编辑的不变性,并抑制沿扰动显著方向的曲率,实验验证了该预测。

主要结果或产业意义

  • 7 个基准(粗/细粒度分类、遮挡/腐败鲁棒性、校准、迁移学习、自监督学习) 上,使用 CNN(ResNet 等)、ViT、视觉语言基础模型(VLM)等多尺度骨干,InstructMixup 均优于 9 种竞争增强方法,包括最强的基线。
  • 训练成本几乎不增加(生成编辑离线缓存,分形注入轻量)。

为什么重要

  • 范式创新:将 mixup 思想从“跨样本混合”转变为“单样本内语义编辑+结构注入”,从根本上避免跨样本语义冲突。
  • 理论可解释:提供了二阶邻域风险近似,定量解释了为何该方法能同时促进不变性和平滑性。
  • 通用性:覆盖 CNN、ViT、VLM,适用于分类、鲁棒性、迁移等经典与前沿任务。

局限与不确定性

  • 本文未讨论生成模型编辑失败(如指令理解偏差导致标签不一致)的情况如何处理,也未提供对超参数(如分形比例、显著性检测阈值)的敏感度分析。
  • 对于长尾或极端少见类别的样本,显著性检测与生成编辑的质量可能下降(待核实)。
  • 与现有已有相关卡片(如 FreqDepthKV、FlowMimic、SRA→Self-Flow)无直接重复,本条提供了全新的单样本数据增强方法。

可用于图书/PPT/简报的角度

  • 数据增强非典型思路:从“混合两图”到“改图内对象”,适合作为深度学习教材中数据增强章节的补充案例。
  • 理论驱动设计:如何用 vicinal risk 的二阶近似指导新的增强算法,可作为机器学习理论应用的讲解素材。
  • 图像生成与增强结合:展示生成模型离线缓存+轻量注入的设计模式,对工业界模型微调有参考价值。

原始材料

  • 标题:InstructMixup: Instruction-Guided Salient Patch Editing for Robust Data Augmentation
  • arXiv ID:2607.19324v1
  • 作者:Khawar Islam, Arif Mahmood, Xin Jin, Naveed Akhtar
  • 发表时间:2026-07-21
  • 类别:cs.CV
  • 摘要:见 arXiv
  • PDF:https://arxiv.org/pdf/2607.19324v1