AI消息速览

Appearance Pointers——扩散Transformer的多模态区域控制

事件日期 2026-07-21 · 学术前沿 · 已接受

事件日期2026-07-21
信息日期2026-07-21
入库日期2026-07-22
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:Appearance Pointers——扩散Transformer的多模态区域控制

一句话结论: 本文提出了一种无需从头重新训练基础模型、可同时处理文本和图像输入的区域控制方法(Appearance Pointers),使扩散Transformer能够根据用户指定的掩码在正确空间位置生成正确的视觉外观。

事件概述或研究问题: 可控图像生成中,创作者常需对材质、物体身份和空间布局进行精确区域控制,仅靠文本提示难以可靠实现。扩散Transformer(DiT)天然支持文本和图像异构令牌输入,但缺乏机制来控制这些令牌在输出中的位置和影响方式。

方法/产品要点:

  • Appearance Pointers(外观指针):紧凑的令牌,通过将文本或图像输入与用户指定的掩码对齐,引导DiT在正确的空间位置使用正确的外观线索。
  • 区域对应网络(Region Correspondence Network):生成外观指针。
  • 空间聚合机制(Spatial Aggregation Mechanism):细化外观指针,使模型能处理多个区域描述而不显著增加令牌负载。
  • 首个模态无关接口(modality-agnostic interface):用于在DiT中实现局部多模态控制,无需重新训练基础模型。

主要结果或产业意义: 在多项指标上,该单模型达到或超越了模态特定的现有最佳方法,提供了一条简单、可扩展的路径,用于生成式图像合成中的精确、区域感知、多模态引导。

为什么重要: 与已有方法不同,本文首次在DiT中实现了无需重新训练基础模型、同时支持文本和图像输入的区域控制,显著降低了部署成本并增强了灵活性。

局限与不确定性: 材料中未提及失败案例、计算资源需求、与其他方法的详细对比数据或用户研究。具体性能指标数值待核实。

可用于图书/PPT/简报的角度:

  • 图像生成中区域控制的技术演进:从文本提示到掩码引导,再到多模态统一接口。
  • 扩散Transformer的可控性研究前沿:如何在不改动基础模型前提下注入空间约束。
  • 创意工具中精准编辑的算法基础:设计师可同时使用文字和参考图像指定局部外观。

原始材料:

  • 英文标题:Appearance Pointers -- Multimodal Region Control of Diffusion Transformers
  • 英文关键词:controllable image generation, Diffusion Transformers, region control, multimodal guidance
  • 来源:arXiv:2607.19344v1, https://arxiv.org/abs/2607.19344v1