生成模型端到端训练新方法:核心仅一个for循环
用“生成多个候选、只训练最像的那个”思路,打破生成模型无法端到端训练的困局。
生成模型长期无法端到端训练,根源在于“mode 模糊”——模型会输出平均结果而非真实样本。UIUC 与哈佛团队提出探索式建模(XM):训练时生成 K 个候选,只选最接近真实数据的那个回传梯度,用一个 for 循环解决该问题,让端到端成为可能。
正文摘录
.jpg) 编辑|Panda 2012 年,AlexNet 用一场压倒性的胜利终结了一个时代。在此之前,做图像识别要靠人手工设计一层层特征提取的流程;AlexNet 证明了一件后来被反复验证的事:把整个任务 端到端 地交给模型自己学,几乎总是打得过人类精心设计的分阶段流水线。 从图像分类到目标检测再到图像分割,深度学习的每一次跃迁背后,都是同一句话:让它自己一口气学完。 只有一个领域始终是例外:生成模型。 今天最强、最能扩展的生成模型(无论是自回归还是扩散模型)都不是端到端的。 它们训练时只学预测「一小步」,推理时却要像循环网络那样把这一步反复展开几百上千次。 训练和推理用的不是同一套采样方式。这个裂缝带来了一个老问题:每一步的误差会喂进下一步,输入逐渐漂离训练时见过的分布,误差层层累积。学术上管它叫 「暴露偏差」(exposure bias) 。 换句话说,「端到端更好」这条深度学习最核心的经验,十几年来始终没能真正落到生成模型头上。 而就在最近,一篇来自 UIUC 与哈佛大学的论文,试图把这块最后的拼图补上。