知识卡片:WithEveryone:面向群像生成的统一规划与身份绑定框架
一句话结论
WithEveryone 提出一个面向最多 10 人参考身份的群像生成统一框架,通过显式的“身份–布局”规划与绑定,显著提升多人场景下的面部相似度,并将复制粘贴伪影从 GPT-Image-2 的 0.169 降至 0.055。
事件概述或研究问题
当一张图像中需要同时包含多个指定人物时,身份保持生成变得非常不可靠。模型不仅要保留每个人的身份,还必须把每个参考人物绑定到图像中不同的具体人物和空间位置;同时,训练阶段的身份损失需要在多个含噪预测人脸之间建立正确对应关系。论文针对这一“群像生成”中的身份与布局联合建模问题,提出统一框架 WithEveryone。
方法/产品要点
- 支持最多 10 个参考身份的统一群像生成框架。
- 将每个选中身份作为“带地址令牌”(addressed token)注入模型。
- 预测结构化的“身份–布局计划”(identity–layout plan),并将其渲染为视觉条件。
- 核心训练目标为 Layout-Grounded ID Loss:利用标注的人脸区域直接监督预期身份,避免基于嵌入匹配人脸的不稳定对应。
- 引入 ID Representation Forcing:在图像合成之前,先针对每个身份训练对应的预测表示(具体实现细节待核实)。
- 整体思路不依赖直接复制参考人脸,而是通过显式身份–布局绑定来扩展群像生成。
主要结果或产业意义
在身份不相交(identity-disjoint)的基准上:
- 目标上下文面部相似度从 GPT-Image-2 的 0.462 提升至 0.499;
- 复制粘贴伪影从 0.169 降低至 0.055;
- 覆盖了 97.3% 的请求身份,重复率仅为 2.8%。
这些结果说明,显式的“身份–布局”绑定能够使身份保持生成扩展到更大的人群规模,同时减少直接参考人脸复制导致的伪影。
为什么重要
现有身份保持生成多聚焦于单人或少量主体,群像场景下的多身份绑定和去重是实际应用中更困难的问题。WithEveryone 的增量在于:将身份注入、布局规划、视觉条件渲染和布局锚定的身份损失统一到一个框架中,为解决“多人 + 多身份 + 位置对应”提供了可量化验证的路径。此卡片与已有单主体或 3D 生成卡片不同,专注于群像生成中的身份–布局一致性,属于该方向的新增信息。
局限与不确定性
- 论文材料目前仅有摘要,方法中“ID Representation Forcing”的具体训练机制、网络结构、训练数据规模与来源均待核实。
- “身份不相交基准”的具体构建方式、评估协议和图片数量待核实。
- 未提供与更多最新方法的系统对比,也未提供失败案例或隐私/伦理讨论。
- 是否开源、推理速度、参数量等信息待核实。
可用于图书/PPT/简报的角度
- 群像生成中的“身份保持”不仅是相似度问题,更是“谁是谁、在哪”的绑定问题。
- 用显式布局条件替代隐式嵌入匹配,可同时提高身份相似度并降低复制粘贴伪影。
- 量化对比:0.462→0.499(相似度提升),0.169→0.055(伪影下降),97.3% 覆盖率与 2.8% 重复率。
- 适合作为“多主体可控生成”或“身份编辑技术演进”主题中的最新案例。
原始材料
- 英文标题:WithEveryone: Unified Planning and Identity Grounding for Group Image Generation
- 英文关键词:identity-preserving generation; group image generation; identity–layout grounding; face similarity; copy-paste artifacts
- 作者:Hengyuan Xu, Qixun Wang, Yiji Cheng, Miles Yang, Zhao Zhong, Wei Cheng, Xingjun Ma, Yu-gang Jiang
- 发布时间:2026-08-20
- arXiv 编号:2608.20336v1
- 类别:cs.CV
- 链接:https://arxiv.org/abs/2608.20336v1