行业新闻

阿里集中升级全模态模型矩阵,下一代视频模型 11 月发布

阿里集中升级全模态模型矩阵,并用陆川复原明代历史场景的案例,说明多模态模型已进入专业创作生产链路。

导演陆川团队用阿里视频生成模型复原 400 年前明代火药库爆炸场景,经四轮提示词优化,画面还原准确度超过团队预期的 95%。阿里同期集中升级全模态模型,覆盖图像、视频、语音、音乐与世界模型,并计划 11 月发布下一代视频模型,方向是从生成单个镜头走向理解完整叙事。

正文摘录

不用搭景,不用等演员,导演陆川和团队,直接用 AI 把一场发生在 400 年前的明代灾难现场,搓出来了! 宫廷、火药库,还有史料中烟云如黑灵芝的大爆炸。按照传统影视工业的做法,这样的场景复原往往需要数月时间和千万级投入。 这次,陆川团队把史料里的文字一点点翻译成现代视觉概念,前后大约做了四轮提示词优化,再参考真实爆炸影像去校准。 最后,阿里视频生成模型对烟尘、碎片这些复杂画面的还原,准确度已经达到团队预期的 95% 以上。 从史料搜集、画面制作到主题讨论,它开始进入完整创作链路;单在视频生成环节,阿里模型的贡献度就超过了一半。 Qwen3.8-Max 开始自己训练自己,Qwen3.8-Flash 提前放出下一代架构,Qwen3.8-Omni 为大模型开辟全新的思考分区,Qwen4 已经开练,Qwen4.5、Qwen5 也在路上。 另外,图像生成模型 Qwen-Image-3.1、音乐生成模型 Happy Shrimp 1.1、世界模型 HappyOyster 2.0 Preview、语音模型家族 Qwen-Audio-3.1、同声传译模型 Qwen3.8-LiveTranslate 也集体亮相。 阿里这一轮全模态升级,已经不太像是在补单项能力。它更在意的,是这些模型能不能更快进入场景,变成真正的生产力。 往外看,图像生成与编辑有 Qwen-Image-3.1;视频生成有 Wan、Happy Horse 系列,以及计划 11 月发布的下一代视频模型;声音这边是 Qwen-Audio-3.1,音乐则交给 Happy Shrimp 1.1。 再往真实世界延伸,HappyOyster 2.0 Preview 开始处理世界模型和交互环境;Qwen3.8-Omni-Flash 把文字、图片、音频、视频放进统一理解框架;

阅读原文(qbitai.com)→

行业新闻田, 晏林2026-09-22原文

相关内容