WithEveryone: 群体图像生成的统一规划与身份锚定
当场景中需包含多个指定人物时,身份保持的图像生成变得愈发不可靠。模型不仅要保留每个身份,还需将每个参考绑定到不同的人物与位置,而训练时的身份损失必须在多个带噪预测人脸间建立对应关系。 为此,我们提出 WithEveryone,一个可生成多达十个参考身份的群体图像的统一框架。WithEveryone 将每个选中身份注入为寻址令牌,预测结构化的身份-布局计划,并将其渲染为视觉条件。其关键目标 Layout-Grounded ID Loss 利用标注的人脸区域直接监督预期身份,避免不稳定的基于嵌入的人脸匹配;ID Representation Forcing 进一步在图像合成前为每个身份训练预测。 在身份不相交基准上,WithEveryone 取得了最高的目标上下文身份相似度,将面部相似度从 GPT-Image-2 的 0.462 提升至 0.499,同时将复制粘贴伪影从 0.169 降至 0.055。它还覆盖了 97.3% 的请求身份,重复率仅 2.8%。 这些结果表明,显式的身份-布局锚定能使身份保持生成扩展到更大群体,而无需直接依赖参考人脸复制。
论文精读
TL;DR WithEveryone 通过身份 token 与布局规划显式绑定多人身份,并用区域锚定损失监督,在 10 人图像生成中将身份相似度提升至 0.499、复制粘贴伪影降至 0.055,实现可扩展的群像生成。
问题
问题背景
身份保持图像生成在单人肖像上已较为成熟,但扩展到包含多个指定人物的群像场景时,模型需同时保持每个身份、绑定参考图像到不同个体并规划合理位置,可靠性显著下降。
现有方法局限
- 主流身份保持方法如
IP-Adapter、InstantID以单身份为中心,依赖参考图像嵌入直接注入生成过程,扩展到多身份时缺乏显式解耦,导致 身份混淆 与 错位绑定,难以将每个参考明确分配给一个生成个体。 - 训练阶段,身份损失通常基于人脸识别网络计算嵌入相似度,但在多人场景中预测的多张噪声人脸尚不稳定,难以建立参考身份与预测人脸之间的对应关系,导致监督失效。
- 多身份生成往往直接复制参考面部区域,产生 复制粘贴伪影,且无法控制各身份在图像中的位置和大小,生成结果缺乏布局合理性。
为什么难 / 重要
多身份生成需要同时解决 身份保持、身份-布局绑定 和 训练期多面孔对齐 三个耦合问题。传统逐像素重构损失不适用于身份级监督,而直接用人脸匹配损失又会因多面孔对应对齐难而退化。业界对可信群像合成的需求日益增长(如数字人、虚拟拍摄、社交内容生成),模型需在身份数量增加时仍保持高覆盖率和低重复率,这对生成架构和损失设计提出更高要求。
行业类比
该问题类似多智能体系统中的 角色分配与场景规划:每个代理必须绑定到特定位置和身份,若绑定错误则整体语义混乱,需要统一的规划与身份 grounding 机制。
核心洞察
- 身份保持生成的核心瓶颈从单脸相似度转变为多身份绑定与空间定位,WithEveryone 通过显式身份-布局规划 + 区域级身份损失解决多人场景下的身份错位与复制粘贴痕迹。与依赖 embedding 匹配的 baseline 相比,它不依赖不可靠的人脸匹配,而是用标注区域直接监督对应身份,将 face similarity 提升到 0.499,copy-paste artifacts 降至 0.055。
- 该方法将身份注入设计为 addressed token,并在图像合成前强制预测身份表征(ID Representation Forcing),使模型在 latent 空间里形成明确的 identity-layout 对应,从而支持最多 10 个参考身份的稳定生成。相比直接将参考图拼接或微调适配器的做法,它在训练阶段就建立了身份与位置的统一表征,在 identity-disjoint benchmark 上实现 97.3% 的身份覆盖率与 2.8% 的重复率,对需要多人合影生成的工程系统有直接落地参考。
方法
输入与身份注入
WithEveryone 接收目标人物数量、每个参考身份图像/描述和场景文本。每个选中身份被编码为带地址的 addressed token,每个 token 含有身份索引,与文本 token 交错输入,天然区分“第几个人是谁”。
关键模块
- Structured Layout CoT:模型先生成结构化的身份-布局计划(位置、大小、相对关系),再将该计划渲染为视觉条件,作为后续扩散生成的空间控制信号。
- ID Representation Forcing:在图像合成前,为每个身份 token 额外预测一个身份表征,强制 token 在扩散去噪前就具备个体判别性,减少多人物下的 ID 漂移。
- Layout-Grounded ID Loss:训练时利用标注人脸区域直接监督对应身份区域,避免传统 embedding 人脸匹配在多人、噪声预测下的不稳定;损失直接约束「该区域必须属于该身份」。
输出
模型输出一张包含最多 10 个参考身份、且身份与布局一致的分组图像,显著减少直接复制参考人脸(copy-paste artifacts)。
与同类身份保持生成方法的差异:WithEveryone 不依赖事后人脸匹配或参考图直接条件化,而把 身份绑定 + 布局规划 + 区域级身份损失 统一到训练目标,使多人场景的身份归属可监督、可扩展。
实验
实验设计
WithEveryone 在 identity-disjoint benchmark 上评估,该基准要求生成最多包含十位指定身份的群像,且训练与测试身份不重叠。模型注入 addressed token,预测结构化 identity–layout plan 并渲染为视觉条件;训练使用 Layout-Grounded ID Loss 与 ID Representation Forcing。
关键发现
定量结果显示,WithEveryone 在目标上下文身份相似度上达到 0.499,高于 GPT-Image-2 的 0.462;同时将 copy-paste artifacts 从 0.169 降至 0.055,身份覆盖率达 97.3%,重复率仅 2.8%。这表明显式身份–布局对齐能有效增强多身份生成的一致性与真实性。
基线对比解读
与 GPT-Image-2 相比,WithEveryone 的身份相似度提升约 8%,伪影指标降幅超过三分之二。提升源于 Layout-Grounded ID Loss 直接利用标注人脸区域监督目标身份,避免了基于嵌入匹配的不稳定性;ID Representation Forcing 在合成前为每个身份建立预测,强化身份绑定。该设计使模型不再依赖直接复制参考人脸,当扩展至十人场景时仍能保持高覆盖与低重复,为多身份生成提供了更可靠的工程路径。
行业影响
落地场景
WithEveryone 直接面向需要生成多身份群组图像的场景:电商平台生成多个不同模特穿着同一系列服装的宣传图,避免实地拍摄多人协调成本;社交媒体内容工具可让用户上传多位朋友照片,生成定制化合影或虚拟聚会海报;影视前期概念设计可快速产出包含多角色的分镜草图。此外,企业培训材料需要多个特定人物同时出现在教学场景中,也可借助此模型生成一致性高的插图。
商业价值
核心降本来自替代真人多人群拍:无需预约多个模特、协调档期和场地,单次推理即可产出高质量群像,边际成本趋近于纯计算费用。体验提升体现在目标上下文身份相似度(target-context identity similarity)从 0.462 提升至 0.499,且复制粘贴瑕疵(copy-paste artifacts)从 0.169 降至 0.055,意味着生成结果更自然,减少因身份错乱或面部粘贴感导致的返工和审核风险。这直接支撑广告素材快速迭代、个性化内容生成等高吞吐业务。
与现有工作流接口
模型可作为身份保持微调模块接入现有扩散生成管线。输入参考图与文本 prompt 后,WithEveryone 先预测身份-布局计划(identity-layout plan),再以此为视觉条件引导生成,适合封装为 REST API 或插件嵌入 ComfyUI / Diffusers 等框架。工程集成时需注意:
- 训练阶段依赖带人脸标注的区域数据,需构建或购买相应数据集;
- 推理阶段可对多身份批量处理,但需控制最大身份数(论文覆盖 10 人)与显存开销;
- 相较 GPT-Image-2 等闭源模型,WithEveryone 开源且可本地部署,便于二次开发和数据隐私控制。
具体落地用例:电商平台为同一款服装生成“多人合穿”营销图,输入 3-5 位模特参考图,模型输出各自穿着该服装且站位合理的群像,直接用于详情页和社交广告。
工程启示:显式身份-布局接地的设计将“谁在哪里”显式建模,相比仅靠文本 prompt 或隐式身份嵌入的方法,更利于扩展到多人场景,减少复制粘贴和身份混淆,可作为后续多对象可控生成的通用范式。
局限
- **数据与标注依赖**:WithEveryone 的关键损失 Layout-Grounded ID Loss 和 ID Representation Forcing 需要训练数据带有精确的人脸区域标注以建立身份对应,这种标注在现有大规模文本-图像数据中通常缺失,需要额外人工或自动标注流程,增加数据构建成本与潜在噪声。这限制了方法向更大规模、开放域数据集的快速扩展,也影响其在数据稀缺的垂直领域的适用性。相比无需布局监督的端到端方法,训练门槛更高,部署时需要额外考虑数据管线。
- **评估与布局建模的局限**:论文的布局评估指标(如 Layout Score 中的 Count / Coverage / Uniqueness / Spatial Validity)可能无法完全捕捉复杂空间关系(如遮挡、交互、透视)和语义合理性。实验主要基于 identity-disjoint 基准,缺乏对真实世界照片、复杂场景和交互动作的全面验证。此外,显式布局规划虽然带来身份绑定稳定性,但也限制了生成多样性,模型可能过度依赖生成的布局条件,在用户未指定布局时表现不确定,与纯生成式方法相比在自由创作场景中灵活性下降。
- **规模与身份保真度上限**:目前方法最多支持十个参考身份,扩展到更多身份时可能存在注意力分配、显存和训练信号稀疏等问题,摘要未给出超过十人的结果。同时,身份相似度指标最高仅为 0.499,距离人类可感知的高保真仍有差距,copy-paste 伪影虽显著降低但仍有 0.055,说明模型在精细人脸纹理、姿态、光照一致性上仍可能产生不自然复制。与商业闭源模型(如 GPT-Image-2)相比提升幅度有限,说明通用生成模型的文本-图像对齐能力仍有优势,该方法需要进一步结合更强 backbone 才能缩小差距。