行业新闻

中科大等500篇文献综述,剖析扩散模型生成一致性问题

中科大等500篇文献综述,剖析扩散模型生成一致性问题

扩散模型生成一致性比画质更关键:综述揭示模型常“不听指令”,并提出三类一致性关系及解决框架。

扩散模型生成质量虽高,但常违反用户指令:漏画物体、颜色位置错误、身份不连贯。一篇500+文献综述将生成一致性分为三类:结果与条件匹配(外部)、跨结果连贯(内部)、符合人类现实标准(规范),并梳理了评估与优化方法。

正文摘录

![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg9632c0b031.png) 新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg3b253ef414-28.png) 【新智元导读】 扩散模型已经越来越会「画」,却还远没有学会「守住要求」。决定系统是否可靠的,已不再只是画质,而是生成结果能否持续遵守条件、维持状态,并符合人类与现实世界的基本标准。 过去几年,扩散模型最显著的进步,是生成质量越来越高。 从文生图、图像编辑,到个性化生成、视频和三维内容创建,模型已经能够产生非常逼真的视觉结果。很多时候,一张生成图片单独摆在面前,我们甚至很难判断它是否来自真实世界。 但当生成任务变得复杂,一个比画质更基础的问题开始暴露出来: 图像看起来正确不代表模型真的完成了任务。 你要求模型生成三只猫,它可能只画出两只;你要求红色方块位于蓝色圆球左边,模型可能生成了两个物体,却把颜色和位置关系弄反;你让模型连续生成同一个人物,它可能在每张图片里都画出一张好看的脸,但这些脸并不属于同一个人。 视频中的问题更加明显。每一帧单独看都很逼真,人物的衣服却不断变化,手里的物体会突然消失,前一秒建立的场景状态在后一秒不复存在。多视图生成也一样:每个角度都像一件合理的物体,但这些视图放在一起,却无法还原成同一个三维结构。 这些失败并不完全属于「生成质量差」。更准确地说,它们属于另一类问题: 模型没有稳定地遵守它应该遵守的关系,即 生成一致性。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-07-03原文

相关内容