北大等联合提出 MAVIN,支持多镜头叙事控制的音视频生成模型
MAVIN 让视频生成模型学会按剧本安排镜头、对白和角色身份,解决多镜头叙事中的时间错位与串脸串音问题。
视频生成模型已能生成单段电影感画面,但“拍完一场戏”还需处理镜头切换、对白时机和角色身份一致性。北京大学等机构提出 MAVIN,一种多镜头音视频联合生成模型,通过结构化脚本、边界感知注意力和身份感知传播,让模型按叙事时间线精准调度画面、声音和角色。
正文摘录
.jpg)  刘恺骐,北京大学博士生,主要研究方向为可控视频生成、音视频联合生成、世界模型、理解生成统一模型及多模态大模型等,相关成果发表于 ECCV、ICCV、CVPR 等国际会议。 过去几年,视频生成模型在清晰度、运动表现和画面质感上不断进步。输入一句文字,模型已经能够生成颇具电影感的视频。 但当任务从「生成一个漂亮片段」变成「完整拍完一场戏」,问题就不一样了。 前一个镜头里,女主说完一句话;画面随即切到男主,他停顿片刻后作出回应;接着镜头切回女主,而男主在画外继续说话。要完成这段内容,模型不仅需要知道画面中有什么,还要准确执行一系列叙事约束:何时切镜?谁在什么时候开口?对白能否与口型和动作对应?切镜之后,人物的脸和声音还能否保持一致? 即使这些要求已经写进脚本,现有模型仍可能出现切镜错位、对白提前或延后,以及多人场景中的串脸、串音。问题不只在于故事有没有说清楚,更在于模型内部是否具备沿着复杂时间线组织音视频内容的能力。 为此,北京大学、可灵团队、中国科学院自动化研究所和中山大学联合提出 MAVIN,一种支持定制化叙事控制的多镜头音视频联合生成模型 。