清华OMG框架实现多模态人形机器人自主运动生成
人形机器人首次具备多模态指令实时生成全身动作的能力,开源方案推动通用控制落地。
人形机器人传统只能机械重复预设动作,无法自主生成新动作。清华大学MARS实验室推出OMG框架,采用“生成大脑+跟踪小脑”分层控制,基于扩散模型构建通用运动生成网络。机器人可实时响应文本、音频、人体动作及组合指令,自主生成稳定可执行的全身运动。千小时级多模态数据集OMG-Data开源,补齐数据规模和可执行性短板。
正文摘录
.jpg)  现阶段大多数人形机器人的运动控制还局限于 “有参考才能动” 的被动跟踪模式。 机器人只能机械重复提前录入的动作轨迹,无法自主生成全新的动作,很难适配日常灵活的人机交互场景。 针对这一行业痛点,清华大学 MARS 实验室推出 OMG 全模态人形运动生成框架,创新打造 “生成大脑 + 跟踪小脑” 的分层控制方案。 团队搭建千小时级专属多模态机器人数据集,依托扩散模型构建通用运动生成网络,让机器人可实时响应文本、音频、人体动作及组合指令,自主生成稳定可执行的全身运动轨迹。 实测结果显示,OMG 不仅多项性能指标领跑主流模型,还具备大模型专属的规模缩放、小样本泛化、零样本模态组合能力,为人形机器人通用智能控制落地提供了全套开源方案。