Ovi模型发布,可同时生成视频和音频
Ovi 现已在 Hugging Face 上发布
双骨干跨模态融合用于音视频生成
Ovi 是一种类似 Veo-3 的视频+音频生成模型,能从文本或文本+图像输入同时生成视频和音频内容。
视频+音频生成:同时生成同步的视频和音频内容
灵活输入:支持纯文本或文本+图像条件
5秒视频:生成 5 秒视频,24 FPS,面积 720×720,支持多种宽高比(9:16、16:9、1:1 等)
双骨干跨模态融合用于音视频生成
Ovi 是一种类似 Veo-3 的视频+音频生成模型,能从文本或文本+图像输入同时生成视频和音频内容。
视频+音频生成:同时生成同步的视频和音频内容
灵活输入:支持纯文本或文本+图像条件
5秒视频:生成 5 秒视频,24 FPS,面积 720×720,支持多种宽高比(9:16、16:9、1:1 等)