AnyMo: 野外人体运动的几何感知、设置无关建模
随着可穿戴和移动设备日益融入日常生活,它们为持续感知野外人体运动提供了实用途径。然而,惯性信号高度依赖传感设置,包括身体位置、佩戴方式、传感器朝向、设备硬件和采样协议。这种设置依赖性使得学习可跨设备和数据集迁移的运动表示变得困难,并限制了可穿戴IMU在封闭集识别之外的广泛应用。 我们提出AnyMo,一个几何感知框架,用于设置无关的人体运动建模。AnyMo通过以下步骤实现:1) 使用物理驱动的IMU模拟,在密集的身体表面位置上生成多样且逼真的合成信号;2) 从成对的合成放置视图和掩码部分观测中预训练图编码器;3) 将多位置IMU信号分词化为全身运动标记;4) 将这些标记与大语言模型(LLM)对齐,实现运动-语言理解。 我们在三个互补任务上评估AnyMo:跨14个未见下游数据集的零样本活动识别、跨模态检索和可穿戴IMU运动描述生成。在HAR任务上,平均Accuracy/F1/R@2分别提升11.7%/11.6%/22.6%;零样本IMU到文本和文本到IMU检索的MRR分别提升15.9%和28.6%;零样本描述生成的BERT-F1提升18.8%。这些结果证明AnyMo可作为野外可穿戴运动理解的通用模型。项目页面:https://baiyuchen.com/project/AnyMo。
论文精读
TL;DR AnyMo 通过几何感知物理仿真与图编码,实现不受穿戴位置、设备差异影响的通用运动建模,零样本跨 14 个数据集提升识别准确率 11.7%,跨模态检索与字幕均显著增益。
问题
问题背景
可穿戴 IMU 感知人体运动因其低功耗、环境无关性而受到持续关注,但实际部署中传感器配置(身体位置、朝向、硬件规格、采样协议)的多样性导致数据异构严重,使得跨设备、跨数据集的运动理解成为开放场景下的关键瓶颈。
现有方法局限
- 固定传感器假设:主流方法大多针对特定身体部位(如手腕、腰部)和固定坐标系训练,无法泛化到传感器位置、方向变化后的信号,只能做封闭集分类。
- 几何关系缺失:预训练或对比学习未显式建模传感器在身体表面的空间相对关系,学到的是依赖具体放置条件的统计特征,而非几何不变的运动表征。
- 仿真与真实鸿沟:已有物理仿真尝试通常覆盖有限的位置/方向组合,生成的合成数据多样性不足,难以模拟野外复杂配置下的信号变化。
为什么这个问题难且重要
技术挑战:
- 需要在信号级融合不同躯体位置、不同坐标系的异构时间序列,同时保持对运动语义的敏感性。
- 模型必须从部分、带噪声的观测中重建全身运动模式,且该过程要对传感器安装方式完全不敏感。
业界关注度:
- 健康监测、人机交互、活动识别等应用强烈需要一个“通用运动底座模型”,能零样本适配新硬件、新佩戴方式,避免为每个新设备重新采集标注数据。
- 该方向是感知 AI 从封闭场景走向开放世界的核心环节,直接影响可穿戴生态的扩展性。
行业类比
类似 NLP 中的多语言预训练模型(如 XLM-R)统一处理不同语言的表层差异,AnyMo 尝试构建统一的“运动语言”,让不同的 IMU “方言”都能映射到相同的全身运动语义空间。
核心洞察
- 几何感知的物理模拟解决跨设备泛化问题:AnyMo 通过在密集身体网格上模拟不同安置位置、朝向和硬件特性的 IMU 信号,生成多样且物理合理的合成数据,以此预训练图编码器,使模型从根本上学习与具体设置无关的运动表征。与此前依赖特定设备配置或有限位置迁移的工作(如 DeepConvLSTM、AttnSense)相比,该方案不依赖目标域数据,实现了真正的零样本跨数据集泛化。
- 运动 token 化与 LLM 对齐构建可穿戴运动通用模型:AnyMo 将多位置 IMU 序列编码为全身运动 token,并利用 LLM 的语言理解能力进行对齐,使得同一模型在不微调的情况下即可完成活动识别、跨模态检索和运动字幕三类任务。这种统一的可穿戴运动-语言范式此前多局限于视觉或文本模态,AnyMo 首次在纯 IMU 领域实现了语言引导的通用运动理解,展现出广义模型的潜力。
方法
AnyMo 面向 wild setting 下多源异构 IMU 数据,以设置无关 (setup-agnostic) 的方式建模人体运动。其方法链遵循“合成信号生成→图编码预训练→运动 token 化→语言对齐”的流水线,实现从原始惯性信号到富语义表征的转换。
输入:多配置 IMU 信号
原始输入为分布在身体不同位置(如手腕、脚踝、腰部等)、不同设备硬件、不同采样率及朝向的 惯性测量单元 (IMU) 信号。这些信号由于传感器布局的多样性,难以直接对齐或共享表示。
关键模块
物理驱动的几何感知运动仿真 (Physics-Grounded Geometry-Aware Motion Simulation):
- 在 密集身体表面网格 上模拟 IMU 放置,根据物理模型(加速度、角速度、重力方向等)合成大量配对且多元的传感器读数。
- 输出不同虚拟放置视角下的信号,为后续学习提供 跨设置对齐 的监督信号。
几何感知的设置无关预训练 (Geometry-Aware Setup-Agnostic Pre-Training):
- 构建 图编码器 (graph encoder),将不同身体位置的 IMU 通道建模为节点,利用图结构捕捉空间依赖。
- 训练采用两种策略:
- 配对合成放置视图对比:拉近同一运动下不同虚拟放置的表示,推开无关样本。
- 掩码部分观测 (masked partial observations):随机遮挡部分通道,迫使模型从残余信号中重建全身运动特征,增强对缺失设置的鲁棒性。
- 预训练后,模型可将任意多位置 IMU 数据编码为 全身运动 token,消除具体传感器布局的影响。
运动-语言建模 (Motion-Language Modeling):
- 将生成的 全身运动 token 作为软提示(soft prompts)输入到 大型语言模型 (LLM),并通过可学习的投影层对齐。
- 利用文本描述(如动作类别、运动说明)进行多任务训练,使模型学会将运动序列映射到自然语言语义。
输出:通用运动理解能力
最终 AnyMo 支持三项零样本任务:
- 活动识别 (HAR):在 14 个未见数据集上,无需微调即可分类动作。
- 跨模态检索:给定文本查 IMU 序列(或反向),通过共享嵌入空间匹配。
- 运动描述生成 (captioning):输入 IMU 信号,输出自然语言运动摘要。
与同类方法的差异
传统方法常绑定特定设备配置,且依赖封闭集标注;AnyMo 通过 物理仿真驱动的图预训练 与 LLM 对齐,在信号层面实现真正的设置无关性,首次将 通用模型范式 引入可穿戴运动理解,使下游泛化不再受限于传感器布局。
实验
实验设计:AnyMo 在三个互补任务上评估,涵盖 零样本活动识别(跨 14 个未见数据集)、跨模态检索(IMU-to-text 与 text-to-IMU)以及 可穿戴 IMU 运动描述生成。模型先通过物理驱动的几何仿真生成覆盖多种佩戴位置的合成 IMU 数据,再以图编码器进行 setup-agnostic 预训练,最终将多位置 IMU 信号量化为 运动 token 并与 LLM 对齐,实现统一理解。
关键发现:在零样本 HAR 上,AnyMo 平均 Accuracy 提升 11.7%,R@2 提升 22.6%,表明模型有效泛化到分布差异大的新设备与协议。跨模态检索中,IMU-to-text MRR 提升 15.9%,text-to-IMU MRR 提升 28.6%,运动与语言的对齐质量显著提升。零样本描述生成的 BERT-F1 提升 18.8%,说明模型不仅能识别动作类别,还能生成与运动一致的语言描述,且无需任何下游微调。
与基线对比的解读:基线方法多依赖原始 IMU 特征或简单域适应,难以应对设备异构导致的分布偏移。AnyMo 的 几何感知仿真 与 图编码器 显式建模传感器布放关系,学到 setup-invariant 的表示,从根本上缓解跨设备泛化难题。运动 token 与 LLM 的对齐首次实现零样本 IMU 语言理解,而传统基线需针对每个新任务收集标注数据,泛化能力与实用性受限。
行业影响
落地场景
AnyMo 的设置无关特性使其可直接嵌入各类消费级 IMU 设备(智能手表、无线耳机、智能戒指、服饰传感器)中,支撑零样本运动理解。典型场景包括:
- 健康与健身:跨设备活动追踪、个性化运动指导、跌倒检测、康复进度评估;
- 人机交互:AR/VR 手势与全身姿态估计、游戏及虚拟形象驱动;
- 工业安全:工人危险行为预警,兼容作业现场多型号穿戴设备;
- 内容平台:视频与传感器数据跨模态检索,运动类 UGC 自动标注。
商业价值
- 降本:零样本泛化大幅减少新硬件、新动作类别的采集标注成本;预训练模型可直接用于 14 个未见数据集,省去重复开发。
- 增收:推动可穿戴硬件厂商将运动理解作为增值服务,例如健康保险基于运动习惯的保费定制,或企业安全合规方案。
- 体验提升:用户跨设备无感切换,运动识别不受佩戴位置、朝向影响;结合 LLM 的自然语言交互,降低使用门槛。
与现有产品 / 工作流的接口
AnyMo 可模块化集成:
- 传感器抽象层:通过基于物理的仿真生成任意位置 IMU 信号,适配不同硬件,无需终端用户标定。
- 运动 tokenizer:将多位置 IMU 数据编码为固定维度的全身运动 token,无缝接入下游 LLM,支持运动-语言问答、检索与字幕生成。
- 部署形态:边缘端推理(如 ONNX Runtime)或云端 API,与现有 MLOps 管线(如 AWS SageMaker, Azure ML)兼容。
具体落地 Use Case
健身应用:某全球健身平台集成 AnyMo,用户佩戴不同品牌的手表、耳塞或绑带传感器进行训练时,应用无需设备适配即可准确识别深蹲、硬拉、跑步等动作,并提供实时反馈与长期运动负荷分析,显著降低硬件合作门槛。
工业安全监控:物流仓储环境部署多种穿戴设备(安全帽 IMU、工牌传感器、鞋垫压力传感),AnyMo 统一抽取全身运动特征,通过 LLM 解读“奔跑 + 弯腰 + 突然停顿”为潜在跌倒风险,触发预警,提升零样本跨设备部署的安全方案适应性。
局限
- **合成数据与真实信号分布存在差距**:AnyMo 依赖基于物理的 IMU 仿真生成训练数据,虽然仿真考虑了传感器摆放、朝向和采样率变化,但仍难以完全复现真实设备中的硬件非线性、温度漂移、固件滤波等特性。在极端真实场景(如松脱穿戴、剧烈冲击)下,合成信号的保真度可能下降,导致零样本迁移性能受限。论文未讨论合成数据的可信度验证方法,这是影响工业部署的关键瓶颈。
- **对多位置 IMU 的依赖未被充分消融**:AnyMo 预训练需要至少两个身体部位的 IMU 视图,评估也集中在 2-4 个传感器配置,未展示单传感器(如仅腕部)的 performance。实际生态中,多数穿戴设备为独立节点,单部位传感极为普遍,该工作的 setup-agnostic 优势在极简配置下可能削弱。此外,密集体表仿真生成的全身运动 token 可能包含冗余信息,增加了不必要的计算开销。
- **运动-语言对齐受限于 LLM 先验和有限标注**:AnyMo 通过冻结 LLM 实现 motion-text 映射,模型的描述能力高度依赖基座 LLM 的常识和语言表达。可穿戴运动描述数据集规模小、多样性低,可能限制复杂长句或细粒度动作的生成质量。论文中的 captioning 提升大多体现在 BERT-F1 指标上,人工评估或具象化描述质量仍待进一步验证。