LongCat-Video-Avatar 1.5 正式开源:从高拟真到真可用
美团开源了商业级数字人视频模型,在唇形同步和稳定性上突破,让数字人视频生成从技术演示走向真实应用。
美团开源了数字人视频模型 LongCat-Video-Avatar 1.5,在唇形同步(让嘴部动作与语音匹配)、物理合理性、长视频稳定性以及多人互动上大幅提升,推理效率也更高。它让数字人视频生成不再只停留在演示阶段,而是能在复杂商业场景中稳定输出高质量内容。
正文摘录
 从高拟真到真可用,LongCat-Video-Avatar 1.5 正式开源 美团 LongCat 2026-05-25 LongCat 大模型 开源 美团正式开源 LongCat-Video-Avatar 1.5 ,作为一款从开源 SOTA(State-of-the-Art,当前最优水平)迈向商业级应用的数字人视频模型。在唇形同步、物理合理性、长视频稳定性、多人互动和高效推理上实现了全面跃升。LongCat-Video-Avatar 1.5 即便在复杂商业场景里,也能稳定、自然地输出高质量内容,让数字人视频生成从彩排室的完美演练,走向千人千面的真实舞台。 为了让数字人“更稳定、更自然”地动起来,我们在以下三方面实现能力升级: - 基础体验全面商用化:在长句、快语速、歌唱等复杂语音输入下,唇部运动更精准平滑,面部表情、头部姿态和肢体动作更协调,整体表达自然稳定; - 支持更丰富的场景:借助高质量数据体系,模型能稳定处理真人、动漫、动物等多类主体,多人对话更加自然且准确区分说话者与聆听者; - 推理部署更高效:采用 DMD(Distribution Matching Distillation,分布匹配蒸馏)蒸馏至 8 步生成,效率提升约 15 倍,更适配规模化应用和真实业务场景。