动态

Ovi模型发布,可同时生成视频和音频

Ovi模型发布,可同时生成视频和音频
AK
Ovi 现已在 Hugging Face 上发布

双骨干跨模态融合用于音视频生成

Ovi 是一种类似 Veo-3 的视频+音频生成模型,能从文本或文本+图像输入同时生成视频和音频内容。

视频+音频生成:同时生成同步的视频和音频内容

灵活输入:支持纯文本或文本+图像条件

5秒视频:生成 5 秒视频,24 FPS,面积 720×720,支持多种宽高比(9:16、16:9、1:1 等)
动态AK2025-10-03原文

相关内容