阿里 TaoLive 开源音视频生成模型 TaoMate-H3,支持分钟级流式续写
阿里开源 TaoMate-H3,把音视频生成拆成三步去噪的小片段流式推进,首段出片更快、能连续续写,电商口播和动漫对白都可用。
TaoMate-H3 是阿里巴巴 TaoLive AIGC 团队开源的音视频联合流式生成模型,基于 MiniMax H3 构建,把每个小片段的去噪压缩到三步 LoRA(低秩适配,一种用少量参数微调大模型的方法),边生成边输出,不必等整段视频跑完。支持人物对白、歌唱与环境音效,可跨提示词继续续写至分钟级,输出 480p/768p/1080p 横竖屏。推理代码与 LoRA 权重已在 GitHub 和 Hugging Face 开放。
正文摘录
.jpg)  TaoMate-H3 是由 阿里巴巴 TaoLive AIGC 团队 研发的音视频联合流式生成模型。基于 MiniMax H3,TaoMate-H3 将三步 LoRA 推理与自回归生成相结合,能够根据文本描述,连续生成包含人物对白、歌声或环境音的视频,支持分钟级续写,以及 480p、768p、1080p 级横竖屏输出。 与整段视频反复去噪的生成方式相比,TaoMate-H3 以小片段为单位推进,每个片段仅需三步去噪,无需等待整段视频完成生成。这一方式 显著缩短了首段内容的产出时间,也为直播讲解、虚拟角色表演和交互式视频应用提供了新的技术基础。 目前,TaoMate-H3 推理代码与 LoRA 权重已正式开放。 开发者可通过 GitHub 和 Hugging Face 下载体验,在此基础上开展应用开发与流式生成研究。以下是本次发布的演示效果。