行业新闻

Sand.ai 开源 114B 参数 MoE 视频生成模型 MAGI-2-preview

首个千亿级开源 MoE 视频生成模型出现,用 6B 激活参数逼近第一梯队,生成成本降至行业十分之一。

Sand.ai 发布 MAGI-2-preview,一个总参数 114B、每次只激活 6B 的 MoE 视频生成模型。MoE 是一种把模型拆成多个专家、按需调用的架构,能在不增加推理成本的前提下扩大容量。官方称生成 10 秒 1080P 视频成本约 5 毛,是行业主流模型的十分之一;在 AA 视频生成榜单排第六。

正文摘录

不卖关子了,这便是 Sand.ai 的最新力作—— MAGI-2-preview 。继 Magi-1 横空出世后,新模型又一次瞄准开源 C 位。 按 8 卡 H100 当下的行情算,要生成一段 10 秒 1080P 视频,其成本仅需 5 毛钱,差不多只有行业主流模型的 十分之一 。 Benchmark 排名也相当亮眼,MAGI-2-preview 在 AA 视频生成榜单排名 第六 。仅用 6B 激活参数,效果就已经非常接近第一梯队。 文本模型倒还好,处理的都是离散 token,叠参数、加算力,模型就能越滚越强。但视频模型呢?面对的却是 一整个动态世界 。 每一帧画面都要被拆成大量空间 patch,连续帧还要记录人物动作、物体关系和镜头变化。如果再叠加文本、音频等信息,序列长度直接超级加倍…… 模型要更大、视频要更长、成本还要可承受,这三件事就是摆在视频生成面前的近乎 「不可能三角」 。 所谓 MoE,就是把模型容量和单次计算部分解耦。模型可以继续拥有百亿千亿的总容量,但每次推理只激活其中一小部分,成本相对可控。 传统专家并行会先为 token 选出 Top-K 专家,再把 token 送到专家所在的 GPU。换言之,只要激活专家数越多,需要运输的数据就越多。 更别提 训练稳定性 ,动态变化的路由、随时波动的专家负载,以及需要处理的多模态数据,都会让大模型 Scaling 过程中常见的问题,在视频 MoE 上 成倍放大 。 单纯迁移 MoE 不管用,还要扛得住超长序列和跨卡通信,同时保证音频、视频、文本在同一套系统里顺畅协作。 行业里很少有人能做到。要说将视频 MoE 从纸上谈兵搬到千亿参数视频模型上, Sand.ai 是第一个 。

阅读原文(qbitai.com)→

行业新闻鹭羽2026-08-05原文

相关内容