蚂蚁灵波开源具身视频基模 LingBot-Video
首个面向机器人的MoE视频生成模型开源,用更少激活参数生成物理合理的动作视频,为具身智能训练提供新底座。
蚂蚁灵波发布并开源全球首个面向具身智能的MoE视频生成模型LingBot-Video,总参数量30B但推理时仅激活3B,效率提升3倍。该模型在RBench评测中超越Wan2.6等模型,能生成符合物理规律的机器人动作视频,可用于动作预测、仿真数据生成等场景。
正文摘录
7月9日,蚂蚁灵波开源 LingBot-Video,这是全球首个基于 Mixture-of-Experts(MoE)架构、面向具身智能(Embodied AI)的开源视频生成基础模型。该模型围绕机器人和具身智能的核心需求重新设计视频预训练范式,在推理效率、物理合理性、动作理解和任务完成度等方面取得系统性提升,为视频基础模型从数字内容创作走向具身智能提供了新的开源底座。 在北京大学联合字节跳动发布的基准 RBench 上,LingBot-Video 的总分是 0.620,超越了 Wan2.6(0.607)、Seedance1.5 Pro(0.584)、Cosmos3 Super(0.581)。RBench 作为面向机器人操作视频的综合评测基准,重点考察模型能否生成符合真实物理规律的机器人行为。这一结果表明,LingBot-Video 在生成机器人相关视频时,更能保持动作过程的合理性和任务执行的完整性。 为进一步验证 LingBot-Video 对物理世界变化的建模能力,蚂蚁灵波在内部 benchmark 中从通用质量和具身领域两个维度进行评估。结果显示,对比 NVIDIA Cosmos3、Wan2.2 A14B、LongCat-Video、Hunyuan Video1.5、LTX-2.3 等五个开源模型,LingBot-Video 在具身领域表现优于主要基线模型。 (图说:综合评测显示,LingBot-Video 在具身相关场景中展现出更强的物理理解和动作一致性) 过去几年,视频生成模型在画质、流畅度和创意表达上快速进步,但对于具身智能来说,一个看起来逼真、动作流畅的视频,却无法反映真实的物理规律,难以支撑机器人连续预测、规划和执行任务。与此同时,具身智能还要求模型具备更高推理效率,以适应实时交互和控制闭环。