行业新闻

北大等提出 UniMotion,将连续运动纳入多模态大模型

UniMotion 首次让连续运动成为多模态大模型的一等公民,实现动作与文本、图像的统一理解和生成,拓展了具身智能与内容创作的可能。

今天的多模态大模型能处理文本、图像,却很少把“人怎样连续运动”当作独立模态。UniMotion 将连续运动(Motion)作为完整模态接入统一多模态模型,可同时完成理解、生成、预测与编辑等七项任务。它用连续 latent(潜在向量)而非离散 token 表示运动,保留动作的细粒度与时间连续性,论文已被 ECCV 2026 录用。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/7e0962e3-ac86-4139-aaae-759837503b1a/026(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 当听到「把双手举过头顶,然后向前走」,人可以在脑中补出一整段动作;当看到一段无声的人体轨迹,也能判断人物是在行走、转身还是踉跄。连续运动既可以被语言描述,也可以作为生成、预测和编辑的条件。 今天的多模态大模型已经能够理解和生成文本、图像,却很少把「人怎样连续运动」作为独立模态。动作从单帧延伸到数秒后,模型还需处理顺序、速度、方向、重心转移与全身协调。 北京大学、东华大学与华南理工大学的研究团队提出 UniMotion ,将连续运动纳入统一多模态模型(Unified Multimodal Model,UMM),在同一框架中连接 Motion、Text 与 RGB。论文已被 ECCV 2026 录用。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-15原文

相关内容