面向具身智能的缩放混合专家视频预训练
尽管机器人控制近期取得进展,但现有视频生成模型因主要面向内容创作而存在域不匹配问题。例如,其设计天然优先考虑视觉保真度和创造力,而非计算效率和物理真实性。 本文提出 LingBot-Video,一种专为具身智能设计的基于 DiT 的视频预训练范式。架构上,采用 Mixture-of-Experts (MoE) 而非稠密框架,以更好地权衡建模能力与推理效率,并从零开始实现缩放。数据上,构建数据画像引擎,用大量机器人导向视频(涵盖操作、导航和第一人称视角)增强标准互联网视频,使基础模型具备对动作和世界动态的内在理解。训练上,开发多维度奖励系统,加强物理合理性和任务完成度对齐,超越美学、提示遵循和运动一致性等常规标准。 综合评估验证了其作为视频基础模型的性能和效率。LingBot-Video 是首个大规模开源 MoE 视频基础模型,致力于弥合数字创造力与物理执行之间的鸿沟。
论文精读
TL;DR LingBot-Video 用 MoE 架构平衡建模能力与推理效率,针对具身智能构建机器人数据引擎和多维奖励系统,成为首个大规模开源 MoE 视频基础模型,弥合数字生成与物理执行鸿沟。
问题
问题背景
视频生成模型在机器人控制中展现出潜力,但当前领域聚焦于如何让模型真正理解物理世界动作与交互,而非仅生成美观画面。
现有方法局限
主流视频生成模型(如基于 DiT 的密集架构)存在三个根本性偏差:
- 架构效率:密集模型参数量大,推理开销高,难以满足机器人实时控制需求,而 Mixture-of-Experts (MoE) 虽能平衡容量与效率,却鲜有大尺度视频预训练实践。
- 数据分布:训练数据以互联网视频为主,缺乏机器人操控、导航和第一人称视角的数据,导致模型无法内化重力、碰撞、力反馈等物理常识,生成的动态场景常违背力学规律。
- 训练目标:评价标准止步于美学质量、运动连贯性和文本对齐,忽略物理合理性与任务完成度,使生成的“漂亮”视频在具身执行中不可行。
为什么这个问题难且重要
将视频模型迁移至具身智能需同时克服三大技术矛盾:
- 容量-效率平衡:机器人硬件算力受限,必须用稀疏激活(如 MoE)降低推理成本,但 MoE 训练不稳定,大规模扩展的工程门槛高。
- 多源数据融合:互联网数据规模大但无结构化物理标注,机器人数据稀缺且视角碎片化,如何统一表示、去偏并注入世界模型是先验难题。
- 奖励信号设计:物理合理性难以量化,任务完成需要多步时序推理,传统像素级损失无法捕捉因果链条。这限制了视频基础模型从“数字创造”走向“物理促动”的产业落地,业界急需一个可复现、可扩展的开放方案来弥合此鸿沟。
行业类比
正如 LLM 从纯文本预训练演进到 RLHF 对齐人类的工具使用意图,视频基础模型也需要从审美生成转向与物理交互的精确对齐,才能真正驱动真实世界的机器人操作。
核心洞察
- **MoE 驱动的视频扩散架构**:首次将 Mixture-of-Experts 应用于 DiT-based 视频预训练范式,在模型容量与推理效率间取得平衡,并从零开始大规模训练。 与主流密集架构不同,MoE 允许模型在推理时仅激活部分专家,显著降低计算开销,这对具身智能的实时性至关重要。 同时,从头扩展 MoE 视频模型也证明其在大规模、多模态场景下的可行性。
- **面向机器人的混合数据引擎**:构建数据剖析引擎,将标准互联网视频与大量机器人操作、导航及自我中心视角视频相融合,使模型获得对物理动作与世界动力学的内在理解。 传统视频生成模型聚焦视觉美感与内容创作,缺乏对真实物理交互的建模;该引擎通过注入多样化、任务导向的机器人数据,弥合了数字创意与物理执行之间的鸿沟。
- **物理对齐驱动的多维奖励系统**:开发超越美学、提示符合度与运动一致性的多维度奖励,强制模型生成结果符合物理合理性与任务完成度。 现有视频生成模型主要服务内容生产,而具身智能要求生成必须可指导真实执行。 该奖励系统从物理定律遵守、交互正确性及目标达成等角度筛选数据,为后续策略学习提供更可靠的基础模型。
方法
LingBot-Video 构建了一个面向具身智能的 DiT (Diffusion Transformer) 视频预训练流水线,核心思路是通过架构、数据和训练目标的协同设计,弥合数字生成与物理交互的鸿沟。
输入构造:机器人导向的数据剖析引擎
- 输入数据分为两部分:海量互联网视频和大量机器人操作、导航及第一视角视频。
- 数据剖析引擎对原始视频进行清洗、标注与增强,自动提取与物理动作、世界动态相关的片段,形成统一视角的训练语料。
- 关键创新在于主动注入机器人感知数据,而非简单依赖通用视频,从而赋予基础模型对动作和场景变迁的内生理解能力。
模型架构:MoE 化的 DiT
- 骨架为 Diffusion Transformer (DiT),但将密集的前馈网络替换为 Mixture-of-Experts (MoE) 层。
- MoE 通过稀疏激活专家模块,在增大模型容量的同时控制推理计算量,解决了纯密集模型在机器人实时控制中效率不足的痛点。
- 该模型从零开始规模化预训练(
scale it up from scratch),没有借助现有密集模型的权重初始化,旨在探索 MoE 架构在视频生成任务上的专属 scaling 路径。
训练目标:多维奖励对齐
- 训练不仅使用标准的扩散损失,还引入一个多维奖励系统,包括:
- 物理合理性:物体运动是否符合动力学常识。
- 任务完成度:生成序列是否达成操控、导航等具身目标。
- 辅助指标:美学质量、指令跟随、运动一致性(作为基线)。
- 该奖励系统以强化学习或可微分引导的形式融入训练,迫使模型生成的对象不仅视觉逼真,更符合现实的物理约束与任务逻辑。
输出与应用
最终产出 LingBot-Video 模型,可作为一个通用的视频基础模型,在下游具身智能任务中(如机器人规划、仿真数据生成)提供高质量的动态视觉先验。
与同类视频生成工作相比,LingBot-Video 的关键差异在于从设计之初即面向物理交互而非内容创作:通过 MoE 架构保障推理效率、通过机器人数据注入增强域匹配、通过多维奖励实现物理对齐,是首个大规模开源的 MoE 视频基础模型,直接瞄准数字创意与物理执行的统一。
实验
实验设计
LingBot-Video 采用 DiT + MoE 架构从零扩展训练,以平衡建模容量与推理效率。数据层面构建 数据剖析引擎,融合大规模网络视频与机器人专属数据(操作、导航、第一人称视角),使基座模型内化动作-世界动力学。训练引入 多维度奖励系统,在传统美学、提示遵循、运动一致性之上,额外强调 物理合理性 与 任务完成度,引导生成结果更贴合具身场景需求。
关键发现
- MoE 稀疏激活 在同等参数量下推理速度优于密集架构,模型容量与效率的权衡显著改善。
- 机器人视角数据增强大幅提升对物理交互与场景动态的理解,生成视频的 物理合理性 指标明显上升。
- 多维度奖励信号有效对齐具身任务目标,模型在物体操纵、导航等任务中表现出更稳定的 动作连贯性 与 世界状态一致性。
- 相比通用视频生成模型,LingBot-Video 在计算资源受限场景下仍可保持竞争力,彰显领域特化预训练的实用价值。
与基线对比解读
主流视频生成模型(如创意内容导向的 DiT 变体)偏重视觉美观与创意表达,在具身任务中存在 领域错配。LingBot-Video 通过 MoE 和物理对齐奖励,在生成结果的 物理真实性 和 任务完成度 上远超此类基线,同时推理开销大幅降低。相较于密集架构,MoE 在等量训练预算下达到更优的 计算-性能 Pareto 前沿,为视频预训练在机器人领域的规模化落地提供了高效范本。
行业影响
落地场景
LingBot-Video 作为面向具身智能的视频基础模型,最直接的落地场景是机器人控制与操作。
例如,在仓储物流中,模型可根据自然语言指令生成符合物理规律的视频计划,再映射为机械臂抓取动作(pick-and-place),从而驱动实际机器人。
此外,模型也可用于自动驾驶仿真,生成多样化的驾驶场景视频,用于感知与控制算法的闭环测试,降低实车采集成本。
在消费级场景,如服务机器人或智能家居助手,LingBot-Video 可提供环境感知与任务规划能力,例如“去厨房拿一瓶水”这样的指令,通过视频预测生成可执行的动作序列。
商业价值
- 降本:传统机器人数据采集和标注成本极高,模型通过互联网视频与机器人专属数据混合训练(data profiling engine),显著降低对真实机器人示教数据的依赖。
- 效率提升:MoE 架构在建模能力与推理效率间取得平衡,稀疏激活减少计算开销,使模型可部署于边缘设备,加速具身智能产品迭代。
- 体验跃升:多维度奖励系统(物理合理性、任务完成)使生成行为更贴近真实物理世界,提升机器人在开放环境中的执行成功率,减少“奇怪动作”带来的安全风险。
与现有产品/工作流的接口
LingBot-Video 可作为视频生成模块嵌入现有机器人软件栈(如 ROS 2 环境)。 具体地,通过提供 REST API 或轻量级推理容器,上游任务规划器将自然语言指令传入模型,模型输出视频序列,再由下游控制器(如 motion planner)解析为关节角度或路径点。 与现有视频生成模型(如 Sora、Stable Video Diffusion)对比,LingBot-Video 专注于物理合理性,输出可直接用于机器人控制,而非仅用于内容观赏,解决了“生成好看但不可执行”的领域鸿沟。 它也可与仿真平台(如 NVIDIA Isaac Sim)集成,作为策略评估的虚拟环境,增强仿真多样性。
具体用例:
- 电商仓库自动化:某物流企业接入 LingBot-Video,将操作指令(如“将红色箱子从货架 A 移到传送带 B”)生成预演视频,并转化为机械臂控制程序,减少人工重编程,提升换产效率。
- 智能家居机器人:家用服务机器人集成该模型,理解“把桌上的水杯放到厨房”指令,生成安全无碰撞的运动规划,相比纯语言模型更直观,且能与现有导航栈(如 Nav2)组合使用。
局限
- 尽管引入 MoE 架构,模型的推理效率依然高度依赖于专家数量与路由策略的调优;在轻量化边缘设备上部署时,稀疏激活带来的计算收益可能被通信开销和内存占用稀释,论文未充分讨论极端资源受限场景下的延迟与功耗表现。
- 数据增强引擎所集成的机器人操作、导航和自我中心视频,其来源、分布与规模均受限于自有采集能力;对于多样化的具身环境和灵巧操作任务,这些数据集可能无法充分覆盖长尾物理交互,泛化性面临挑战。
- 多维奖励系统融合物理合理性与任务完成度,但这些指标的客观量化和自动化评估仍存在难度——例如,物理合理性依赖模拟器或人工判断,可能引入测量噪声,削弱奖励信号的稳定性和可复现性。