动态

扩散模型与LLM应解耦,避免影响表示学习

扩散模型与LLM应解耦,避免影响表示学习
Saining Xie
确实。对于文本到图像,@xichen_pan 有一段很好的总结支持这种解耦设计理念:“将生成的事交给扩散,将理解的事交给LLM。” 我们反复观察到扩散梯度会对骨干表示产生负面影响。这种效应在更简单的设置中也会出现——例如,我们在REPA-E(https://t.co/IVDJhg4HGw)中一定程度上探讨了这个问题。我相信同样的原则也适用于VLA。从根本上说,问题似乎是扩散梯度过于关注高频细节——无论是在像素还是动作策略中——这往往与表示学习和理解相冲突。顺便说一句,@ylecun 一直是对的——远在这些经验发现之前。
You Jiacheng
正如预期,这与@sainingxie 在统一多模态理解与生成模型中的发现一致:冻结的VLM可能对你有帮助。https://t.co/AwGBiNdN6R https://t.co/yDEycR49M5
动态Saining Xie2025-05-28原文

相关内容