北大等提出 UniMotion,将连续运动纳入多模态大模型
UniMotion 首次让连续运动成为多模态大模型的一等公民,实现动作与文本、图像的统一理解和生成,拓展了具身智能与内容创作的可能。
今天的多模态大模型能处理文本、图像,却很少把“人怎样连续运动”当作独立模态。UniMotion 将连续运动(Motion)作为完整模态接入统一多模态模型,可同时完成理解、生成、预测与编辑等七项任务。它用连续 latent(潜在向量)而非离散 token 表示运动,保留动作的细粒度与时间连续性,论文已被 ECCV 2026 录用。
正文摘录
.jpg)  当听到「把双手举过头顶,然后向前走」,人可以在脑中补出一整段动作;当看到一段无声的人体轨迹,也能判断人物是在行走、转身还是踉跄。连续运动既可以被语言描述,也可以作为生成、预测和编辑的条件。 今天的多模态大模型已经能够理解和生成文本、图像,却很少把「人怎样连续运动」作为独立模态。动作从单帧延伸到数秒后,模型还需处理顺序、速度、方向、重心转移与全身协调。 北京大学、东华大学与华南理工大学的研究团队提出 UniMotion ,将连续运动纳入统一多模态模型(Unified Multimodal Model,UMM),在同一框架中连接 Motion、Text 与 RGB。论文已被 ECCV 2026 录用。