介绍Any2Caption框架利用MLLM实现可控视频生成
感谢 @_akhaliq 分享我们的工作!一个 SOTA 可控视频生成框架,利用 MLLM 将任意条件解释为密集结构化标题。论文:https://arxiv.org/abs/2503.24379 项目:https://sqwu.top/Any2Cap/
Any2Caption:将任意条件解释为标题以生成可控视频 https://t.co/pGfaYtthbI
Any2Caption:将任意条件解释为标题以生成可控视频 https://t.co/pGfaYtthbI