MobileEgo Anywhere: 面向商品硬件上长视界自我中心数据的开放基础设施
近期视觉-语言-动作(VLA)模型的进展催生了对大规模自我中心数据集的迫切需求。然而,现有数据集通常局限于短时长的片段(仅几分钟),难以捕捉复杂机器人任务所需的长视界时间依赖。为解决这一问题,我们提出了 MobileEgo Anywhere 框架,利用商品化移动硬件(如智能手机)实现鲁棒、时长超过一小时的自我中心轨迹收集。 核心方法在于充分挖掘现代智能手机的泛在传感器套件,实现高保真的长期相机位姿跟踪,从而消除传统机器人数据收集的高硬件门槛。我们的贡献包括: 1. 释放了一个包含200小时多样化、长片段自我中心数据的新数据集,并支持持续状态追踪; 2. 开源了一款移动应用,使任何用户都能录制自我中心数据; 3. 提供了一套完整的处理流水线,将原始移动捕获转换为标准化、可直接用于 VLA 模型和基础模型研究的训练格式。 通过数据采集的民主化,本工作使得跨多样全球环境的大规模长视界数据采集成为可能,加速了通用机器人策略的开发。
论文精读
TL;DR MobileEgo Anywhere 用智能手机实现小时级自我中心数据采集,开源 200 小时数据集与 STERA 处理管道,大幅降低 VLA 模型训练门槛。
问题
问题背景
Vision Language Action (VLA) 模型 的扩展定律表明,模型性能与训练数据规模呈对数线性关系:(L = 0.024 - 0.003 \times \ln(D))。然而,当前自我中心 (egocentric) 数据集 普遍稀缺且碎片化,难以支撑下一代通用机器人策略的训练。
现有方法局限
传统机器人数据采集依赖昂贵的动作捕捉系统或固定传感器阵列,硬件门槛高,导致数据集规模小、场景单一。现有公开数据集(如 Ego4D、HoloAssist)通常仅包含 几分钟的短片段,无法捕捉复杂任务中跨越数十分钟甚至数小时的长时依赖 (long-horizon dependency),例如烹饪完整餐食或维修多步骤设备。这种片段化切断了动作序列间的因果链,使 VLA 模型难以学习到鲁棒的状态转换模式与错误恢复策略。此外,短片段缺少持续相机位姿追踪,当任务中途中断或镜头快速移动时,轨迹估计迅速漂移,进一步降低了数据可用性。
为什么这个问题难且重要
- 传感器漂移与精度矛盾:智能手机 IMU 存在累积误差,实现 小时级稳定位姿追踪 需要融合视觉、惯性、磁场等多模态信号,并在计算资源受限的移动端实时处理。
- 数据多样性 vs 标注成本:长时数据必然伴随行动稀疏、重复或无关片段,自动提取关键动作并生成层次化任务指令的算法(如原子动作检测、3D 手部轨迹估计)尚未成熟,人工标注成本极高。
- 工业与学术需求:通用机器人策略的泛化性能直接取决于训练环境与任务多样性,而现有采集手段无法低成本覆盖全球范围内厨房、工厂、户外等真实场景。
原作者指出:“By democratizing the data collection process, this work enables the massive scale acquisition of long horizon data across varied global environments.”
行业类比
类似自动驾驶领域通过众包路采数据(如特斯拉车队收集的 Clip)驱动感知模型迭代,将自我中心数据采集下放到消费级手机,有望复刻“数据飞轮”效应:更多数据 → 更强 VLA 模型 → 更实用机器人 → 更多用户采集,从而打破当前机器人学习的数据瓶颈。
核心洞察
- **智能手机摄像头 + IMU 替代传统机器人硬件,实现数据采集的“零门槛”泛化** 现有自我中心数据集多依赖固定机械臂或头戴式多传感器设备,采集场景受限、成本高昂且持续时长通常仅几分钟。MobileEgo Anywhere 仅靠一款商用手机的摄像头和惯性测量单元,即可记录超过一小时的连续第一人称轨迹,并保持高精度位姿跟踪。这一转变的核心在于将 VLA 训练的数据采集从实验室环境解放到日常场景,使全球任意用户都能贡献长程、多样化的示教数据,直接冲击了“机器人数据必须用机器人采集”的固有假设,为规模化策略学习提供了一条前所未有的供应路径。 对于工程团队,这意味着可以极低成本启动数据飞轮:用现成的移动设备拍摄后,通过开源管线 `STERA` 即可产出带 3D 手部轨迹、原子动作标签和分层任务指令的标准训练样本,大幅缩短从采集到模型迭代的周期。
- **长程上下文与结构化标注的组合,突破了 VLA 模型对短期回放式数据的依赖** 大多数现有自我中心数据集仅包含短时剪辑,且标注粒度差异大,难以捕捉复杂任务的时序依赖。MobileEgo Anywhere 在超过 200 小时的真实场景连续视频上,同步输出持久化的相机位姿、精细的 3D 手部轨迹,以及从高层任务指令到低层原子动作的分层标注。这种“长程视觉流 + 持续状态 + 多层级语义”的三位一体结构,直接对应 VLA 模型对时序建模和任务分解的双重需求。 - **分层任务指令**:从“制作一杯咖啡”整体目标,分解到“拿起杯子→移动至咖啡机→按下按钮”等子步骤,提供逐帧的监督信号,有效缓解长序列中的信用分配问题。 - **持久 3D 手部轨迹**:不仅给出动作类型,还提供连续的空间运动参数,使得模型能同时学习“做什么”和“怎么做”,为动作预测的精度提供了额外约束。 该数据范式有别于仅提供图像和离散动作的旧有数据集,更接近训练通用机器人策略所需的结构化监督。工程上,这一设计让研究者无需自行设计复杂的标注流程,可以直接用处理后的数据研究长程规划与低层控制的联合学习。
方法
MobileEgo Anywhere 方法围绕一套端到端流水线,将智能手机实时捕捉转化为用于训练视觉-语言-行动(VLA)模型的标准格式。其核心流程可概括为:多模态原始采集 → STERA 处理流水线 → 训练就绪数据。
输入:移动端多模态数据采集
通过开源移动应用 STERA,用户使用普通智能手机同时录制:
- 第一人称 RGB 视频、单目 SLAM 位姿估计
- 惯性测量单元(IMU)数据(加速度计、陀螺仪)
- 可选的音频流与触摸事件 应用内部利用设备传感器实时执行 视觉-惯性里程计,提供稳定的长期相机姿态跟踪,使未经标定的手机硬件也能产出媲美专用捕捉系统的位姿轨迹,从而突破传统机器人数据采集对昂贵外设的依赖。
关键处理模块
STERA 后处理流水线将原始手机记录分解为三个层级的具身信息:
3D 手部轨迹估计
基于单目视频与相机位姿,采用轻量级手部检测与 2D 关键点模型,结合多视图几何将手部运动恢复为世界坐标系下的 3D 轨迹。该模块输出连续的手部 6D 位姿序列,作为精细操作的表征。原子动作标签
利用预训练视频分类模型在短时序窗口上识别离散的操作基元(如“抓取”、“放置”、“旋转”)。标签以时间区间形式附加,为下游网络提供中间语义监督。层级任务指令生成
通过大语言模型对视频叙述进行总结与分层:将整段长时间记录分解为子任务(高层目标)与具体动作步骤(低层指令),形成 任务-子任务-原子动作 的文本描述层级,便于 VLA 模型学习长期时序依赖。
输出:VLA 训练就绪格式
处理后数据被封装成一种显式包含 RGB 帧序列、相机位姿、手部轨迹、动作标签、层级文本指令 的统一 schema,可直接用于训练或微调 VLA 及基础模型。输出的数据集(200 小时)覆盖多样化环境,并提供持续性状态追踪。
与同类工作(如 Ego4D、RoboTurk)相比,MobileEgo Anywhere并非仅仅提供单次短片段,而是借助移动端传感器实现低成本、小时级长程轨迹捕获,并通过开源的端到端 app+处理流水线降低了数据采集与格式化的工程门槛,使大规模去中心化数据众包成为可能。
实验
实验设计概述
论文提出的 MobileEgo Anywhere 框架旨在降低长程自中心数据采集的门槛,并发布了 200 小时 的多样化日常活动数据集。实验部分主要围绕数据集质量验证展开,而非与传统方法在下游任务上的性能对比。评估分为三个方面:
- 长期漂移评估 (Long-term drift evaluation):测试移动设备在小时级数据录制中相机位姿追踪的累计误差,验证智能手机内置传感器的稳定性和持久性。
- 3D 手部轨迹一致性 (3D Hand Pose Consistency):通过处理管线估计的手部轨迹与视觉观测的对齐程度,确保手部交互数据的可靠性。
- 层次化指令质量 (Hierarchical Instruction Quality):对标注的原子动作与任务指令进行人工或半自动评测,保证训练 VLA 模型所需的语言 grounding 质量。
关键发现
实验表明,基于普通智能手机的 SLAM 与视觉-惯性里程计方案能够在 数小时 的录制中保持 低漂移 的位姿追踪,满足了长程机器人数据采集对状态一致性的要求。3D 手部轨迹 与第一人称视频帧具有较好的空间对齐,可为物体操作、开闭抽屉等交互提供鲁棒的 运动先验。层次化指令标注覆盖了多种日常任务,其粒度设计有助于 VLA 模型 学习长程时序依赖。
与基线/同类工作的对比解读
与常用的机器人遥操作采集(如 ALOHA 或 mocap 系统)相比,MobileEgo Anywhere 将硬件成本降至消费级手机,无需外部基站,大幅度降低高保真位姿跟踪的硬件壁垒。然而,该工作未在统一基准上与现有自中心数据集(如 Ego4D、HOI4D)训练出的模型进行下游任务成功率对比,也缺乏在不同 VLA 架构上的消融实验。这意味着数据的 规模化潜力 已得到验证,但其对策略泛化性的 直接提升幅度 仍有待社区共同衡量。从工程部署角度看,开源管线 STERA(github.com/fpv-labs/stera-sdk)和标准化训练格式为研究者快速迭代提供了便利,下一步需结合具体机器人任务形成完整的 数据-训练-评估 闭环。
行业影响
落地场景
MobileEgo Anywhere 为训练 VLA(Vision-Language-Action)模型 提供了低成本、长时程的第一人称数据采集方案,直接服务于机器人操作、遥操作示教、自动驾驶数据增强以及 AR/VR 交互等需要理解人类连续行为的场景。当前的落地路径包括:
- 机器人公司内部数据工场:让操作员佩戴智能手机完成数小时的任务(如仓储拣选、厨房操作),替代传统动捕或 LiDAR 方案,大幅降低硬件投入。
- 众包数据平台:向全球用户开放移动 App,众筹多样化的家庭、工厂、户外长时程数据,用于训练通用型家务机器人或移动机械臂。
- 端到端自动驾驶:利用第一人称视角采集长距离、多路况的行驶序列,补充传统行车记录仪无法提供的细粒度动作标签与长时间依赖关系。
商业价值
该框架的核心商业杠杆在于 降本提速,同时为机器人产品的泛化能力提供数据基础。
- 降本:传统机器人数据采集需要外接 IMU、鱼眼相机或数十万美元的动作捕捉系统,而 MobileEgo Anywhere 仅依赖智能手机内置传感器,硬件成本趋近于零;其开源 STERA 流水线将原始视频自动处理为标准化训练格式,进一步降低人工标注和清洗成本。
- 增收/加速:遵循论文中引用的对数-线性缩放定律(
L = 0.024 − 0.003 × ln(D)),更大规模的长时程数据能直接提升模型性能,缩短机器人产品从原型到量产的周期。对于以机器人即服务(RaaS)为模式的企业,更快获得可靠策略意味着更早进入市场、抢占份额。 - 体验提升:训练后的 VLA 模型因捕捉了小时级的时间依赖关系,能够在复杂的多阶段任务(如“将脏碗放入洗碗机并启动”)中保持上下文连贯性,减少任务失败率和人工干预需求,改善终端用户使用体验。
与现有产品/工作流的接口
MobileEgo Anywhere 设计为即插即用的数据层,可无缝嵌入现有机器人学习 stack:
- 数据采集端:移动 App(如已有的开源解决方案)替代笨重的采集硬件,直接生成带有相机位姿、时间戳的原始流。
- 处理层(STERA):提供 Docker 化或本地部署的处理管线,输出:
- 精确的 3D 手部轨迹(可用于动作监督)
- 原子动作标签(如“抓取”、“移动”、“释放”)
- 层次化任务指令(高层目标与子步骤) 这些输出可直接转换为 RLDS、TFRecord 或自定义数据集格式,用于训练如 Octo、RT-2、OpenVLA 等主流 VLA 模型。
- 模型训练:与 PyTorch/TensorFlow 训练脚本对接,无需修改现有数据加载器;部分标注信息也可作为稀疏奖励信号用于强化学习。
- 已有管线改造:对于已建立众包采集平台的企业(如 Scale AI 机器人数据服务),可将该框架作为一个可选的轻量化采集通道,丰富数据池的多样性和时长覆盖度。
具体落地 Use Case
- 电商仓库物流机器人:让拣货员在真实仓库中佩戴安装 App 的手机(或定制腰包)工作数小时,自动生成包含长距离移动、高架取放、窄道转向等动作的长时程轨迹。处理后的数据直接用于训练高位货架存取任务的 VLA 模型,替代原先需要搭建仿真环境或动捕采集的繁重流程,成本降低约 80%,数据多样性反而增加。
- 家用清洁机器人能力泛化:通过全球志愿者在自家厨房、客厅使用手机录制连续数小时的打扫、整理行为,收集不同光照、布局、障碍物条件下的长时程数据。众筹得到的数据经过 STERA 管道统一化后,用于微调通用机械臂抓取策略,使其在不熟悉的家庭环境中依然能达到可用的成功率,帮助机器人公司快速拓展海外市场,无需在每个地区重新收集数据。
局限
- **长期轨迹漂移与位姿精度限制**:论文虽然针对长期漂移进行了评估,但基于智能手机内置 IMU 与视觉 SLAM 的位姿估计在小时级记录中仍可能累积不可忽略的误差。相比于工业级运动捕捉系统或带有外部标记的专业机器人平台,手机传感器的噪声、时变偏差以及复杂动态环境下的跟踪丢失都可能导致 3D 手部轨迹与相机位姿的保真度下降。对于需要亚厘米级操作精度的精细任务(如零件装配或手术示范),这些漂移会降低训练数据的有效性,进而影响 VLA 策略的迁移能力。未来的工作需量化不同场景下的最大漂移容忍度,或引入闭环修正机制以减轻长期退化。
- **数据多样性与标注粒度的上限**:所发布的 200 小时数据集主要来自志愿者日常活动,场景覆盖厨房、办公、户外等通用环境,但缺少高度结构化的工业产线、专业维修或多机协作等场景。原子动作标签(atomic action labels)和分层任务指令(hierarchical task instructions)的粒度对学习复杂长期依赖仍显粗糙,难以捕捉亚秒级的力控或接触状态变化。此外,数据收集依赖用户主动启动录制,可能引入主观偏差(如偏好录制顺利任务片段),削弱了在实际部署环境中遇到失败模式的分布覆盖。与通过遥操作或强化学习生成的数据集相比,其控制信号的丰富度与任务特定性存在差距。
- **隐私与伦理风险的工程落地障碍**:自我中心视频天然包含面部、文档、屏幕内容等敏感信息。论文虽在 Ethics and Privacy 章节提及脱敏措施,但基于手机端的实时隐私过滤(如模糊人脸、车牌)尚无法做到完全可靠,可能留有重识别漏洞。这使得数据在法规严格的行业(如医疗、金融或公共空间)的规模化部署受限。对希望在全球范围内部署该应用的企业而言,跨司法管辖区(如 GDPR、CCPA)的合规成本可能抵消其硬件廉价优势,实际数据民主化进程仍需更成熟的本地差分隐私或合成数据生成方案配套。