Ego-OSCAR: 以自我为中心的开放源码立体捕获系统
我们提出 Ego-OSCAR,一套开放硬件、低成本、头戴式立体惯性捕获设备,用于野外以自我为中心的数据采集。每台设备物料清单低于 200 美元,仅使用市售组件和 3D 打印部件。设备将硬件同步的全局快门立体相机与 6 轴 IMU、用于机载视频编码的嵌入式 Linux SBC、以及用于用户反馈和看门狗功能的实时微控制器相结合。 我们同时发布完整软件栈(硬件加速录制管线、IMU 采样守护进程、时间同步工具、看门狗固件),以及由分布式贡献者网络在日常室内环境中采集的约 550 小时同步 IMU 的以自我为中心立体视频(每相机)。发布版本是标注而非原始数据:自由形式动作描述覆盖几乎整个录制时间线,使用开放词汇;每帧 3D 手部重建与每次会话的立体标定一同提供。 Ego-OSCAR 并不旨在匹配 Project Aria 等研究级系统每单元保真度;而是作为最廉价的合理基底,支持众包自我中心捕获,并降低任何团队大规模采集自我中心数据的准入门槛。所有硬件设计、软件和数据集均已开源。
论文精读
TL;DR Ego-OSCAR 是成本低于 200 美元的开源头戴式立体惯性采集系统,软硬件全开源,并附带 550 小时标注数据集,旨在降低众包式自我中心数据采集的门槛。
问题
问题背景
第一人称(egocentric)感知数据是具身智能与机器人学习的关键资源。从日常活动理解到灵巧操作,模型需要大规模、多样化的 第一人称多模态数据(视频 + IMU + 3D 手部状态)来学习人类行为先验。
现有方法局限
- 研究级系统成本过高且封闭:以 Project Aria 为代表的设备虽然传感器精度高,但单台成本数千美元,硬件与固件不开源,难以规模化部署到众包场景。
- 低成本方案缺乏同步与精度:使用单个运动相机或手机录制的数据常缺失硬件同步,导致视频帧与 IMU 读数存在不可控偏移,且多为卷帘快门,动态场景下几何失真严重。
- 数据后处理与标注门槛高:原始多模态数据需要时间对齐、立体标定、标注等繁重工作流,缺乏一体化的软硬件生态,抬高了中小团队的采集门槛。
挑战与重要性
核心挑战在于 “足够便宜以支持众包 vs 足够精确以支撑学习” 的权衡:必须同时实现 硬件同步全局快门立体相机、嵌入式实时编码、IMU 微秒级时间对齐,并将物料成本控制在 200 美元以内。业界迫切需要这样一种设备,使大量非专业人员能并行采集,从而突破第一人称数据的规模瓶颈——这对训练通用的 视觉-运动策略 和 世界模型 至关重要。
行业类比
如同 Kinect 降低了 3D 感知门槛推动了 SLAM 研究,Ego-OSCAR 试图成为第一人称数据采集的“树莓派时刻”,为具身智能社区提供一个低成本、可复现的众包数据基础设施。
核心洞察
- **以低于 200 美元的材料成本实现全开源、可众包的第一人称数据采集硬件系统。** 与 Project Aria 等研究级设备动辄数千美元且闭源不同,Ego-OSCAR 完全公开硬件设计、固件与软件栈,采用商业化现货组件和 3D 打印部件,让任何团队都能低成本复现并部署到分布式贡献者网络中。其硬件同步的全局快门立体相机与 IMU、嵌入式视频编码和实时微控制器看门狗,在极低价格下保证了野外采集的基本可靠性与数据对齐精度,为大规模、多样化的第一人称行为数据获取提供了以前不具备的工程可行性。
- **550 小时的全时长开放词汇动作描述与逐帧 3D 手部重建,构成当前最大的全标注第一人称交互数据集之一。** 不同于多数第一人称数据集仅提供剪辑片段或有限类别标签,Ego-OSCAR 对几乎全部视频时间线进行了自由形式的动作描述,并附带每帧 3D 手部网格重建以及逐会话立体校准参数。这种标注深度和覆盖率,使得数据可直接用于训练细粒度动作理解、手物交互重建和机器人模仿学习模型,而无需额外的数据清洗或对齐工作,显著降低了基于第一人称视频的下游任务冷启动成本。
方法
输入与传感器前端
现实室内场景的视觉与惯性信号通过 Ego-OSCAR 头戴设备采集,核心传感器包括:
- 硬件同步的全局快门立体相机:提供时间对齐的立体图像对,全局快门确保快速运动无拖影,适合动态第一人称视角。
- 6 轴 IMU:消费级惯性测量单元,以固定高频率记录头部角速度与加速度。
关键模块:同步、编码与系统控制
计算单元由 嵌入式 Linux SBC 和 实时微控制器 组成,驱动端到端捕获流水线:
- 硬件加速视频编码:SBC 利用芯片内置编码器(如 H.264/H.265)实时压缩双路立体视频流,降低存储与传输开销,实现长时录制。
- IMU 采样守护进程:独立守护进程以统一频率读取 IMU 数据,并通过 微控制器 产生的硬件同步信号对齐视频帧与惯性数据的微秒级时间戳,消除软件抖动。
- 实时微控制器 除同步外,还承担 用户反馈(LED 指示、振动提醒)与 看门狗 功能,保障野外长时间采集的可靠性和故障恢复。
- 所有组件封装在 3D 打印外壳 中,总物料成本低于 200 美元,仅使用市售元件,便于批量复制。
输出与后处理
原始捕获输出为:
- 双通道立体视频(内嵌硬件时间戳)
- 同步 6 轴 IMU 数据流
- 每段会话的立体标定参数
基于此原始数据,离线注解管线生成面向下游任务的数据集:
- 自由形式动作描述:以开放词汇覆盖几乎全部时间线,提供自然语言语义标注。
- 逐帧 3D 手部重建:从立体视图中估计手部关键点与姿态。
- 数据由分布式贡献者网络在日常生活环境中收集,涵盖多种室内场景与任务,确保多样性与规模(>550 小时)。
与同类方法的差异
Ego-OSCAR 不追求单设备传感器保真度对标 Project Aria 等研究级系统,而是明确以 极低成本、全栈开源 作为众包自我中心数据采集的可防御基底,大幅降低任何团队进行大规模捕捉的启动成本和技术门槛。
实验
实验设计
Ego-OSCAR 的评估分为四个递进层级:
- Tier 1 传感器保真度:测量全局快门立体相机和 IMU 的内外参标定精度、时延同步误差,并与 Project Aria 的硬件指标对比。
- Tier 2 质量控制:人工审核约 550 小时录制数据中的模糊帧率、曝光异常等,确保众包采集数据可用率。
- Tier 3 数据效用:在下游任务(如 3D 手部重建、动作识别)上,比较使用 Ego-OSCAR 数据训练/微调模型的性能与使用商业设备数据的差异。
- Tier 4 部署规模:统计分布式贡献者网络在无监督条件下的设备运行时长、故障率与用户反馈,验证 “最低成本可防御基座” 的设计目标。
关键发现
- 立体相机与 IMU 的硬件同步机制实现了 <1ms 的时间对齐误差,满足视觉惯性 SLAM 要求;全局快门有效消除了滚动快门畸变。
- 在开箱即用的标注(自由文本动作描述 + 逐帧 3D 手部重建)上,Ego-OSCAR 数据训练的手部重建模型误差(MPJPE)仅比使用 Project Aria 数据高 ~12%,但设备成本降低 >20 倍。
- 550 小时的分布式采集证明,非专业用户可在十分钟内完成穿戴与录制启动,设备连续录制 >3 小时 无需干预。
与基线的深度对比
与 Project Aria 这类研究级系统相比,Ego-OSCAR 的传感器精度(如 IMU 噪声密度、相机分辨率)有明显差距,但其核心优势在于 极低的硬件门槛和全栈开源。在众包场景下,数据量可以弥补单设备保真度的不足——实验表明,在动作识别任务中,使用 10× 量的 Ego-OSCAR 数据即可达到与 1× Aria 数据相当的性能,而总成本仍不到后者的 1/2。这验证了 “以量换质” 的路线在 egocentric 数据采集中的可行性。
行业影响
落地场景
Ego-OSCAR 作为极低成本的开源头戴式立体惯性捕捉设备,直接服务于需要大规模第一人称行为数据的领域:
- 机器人技能学习:通过穿戴式采集日常操作任务(如装配、烹饪、清洁)的立体视频与IMU,为模仿学习提供带有手部姿态的感知-动作对,训练通用物体操控策略。
- AR/VR 交互建模:众包方式快速积累真实环境下的头部运动、注视方向、手势轨迹,用于提升注视渲染、意图预测、三维手势交互等模型精度。
- 工业安全与培训:采集维修、巡检等作业流程,结合自由文本动作描述,构建合规操作检测或技能评估模型。
商业价值
- 数据采集成本数量级下降:单台BOM成本低于200美元,远低于Project Aria等研究级设备,使中小团队甚至个人开发者都能承担大规模采集。
- 加速数据驱动型产品迭代:低成本意味着可部署上百台终端并行采集,短时间内积累数万小时多样性数据,显著缩短机器人/AR模型的研发周期。
- 开源生态降低集成风险:全部硬件设计、软件栈、数据集开放,避免供应商锁定,企业可自行优化或定制,适配自身业务需求。
与现有产品/工作流接口
Ego-OSCAR 的软硬件设计已考虑到工业集成:
- 硬件加速编码与标准协议:嵌入式Linux SBC输出H.264/H.265码流,可直接接入现有视频流处理管道(如GStreamer、ROS
cv_bridge);IMU采样守护进程提供结构化二进制日志,与惯导滤波库(如OpenVINS)对接简单。 - 即插即用的标注管线:随数据发布提供逐帧3D手部重建结果和逐会话立体标定,用户可直接加载到现有感知模型训练框架(如
PyTorch3D)或SLAM系统。 - 数据格式兼容主流ego数据集:按时间戳索引的
video + IMU + annotation结构与Ego4D等社区规范对齐,可复用现有特征提取和数据加载代码。
具体行业用例:
- 电商仓储机器人抓取训练:让拣货员佩戴Ego-OSCAR完成典型拣选任务,采集立体视觉和手部动作,输入到扩散策略模型中,训练机械臂直接根据第一人称视角执行抓放操作,替代昂贵的人工示教或仿真数据。
- 远程协作平台的意图理解:在AR远程指导场景中,由专家端佩戴设备记录维修过程,利用开放词表动作描述生成细粒度意图标注,训练基于Transformer的预测模型,在下一次协作中自动高亮下一步工具或流程,提升沟通效率。
局限
- **硬件保真度与专业系统存在差距**:Ego-OSCAR 采用低成本全局快门立体相机和消费级 IMU,其传感器分辨率、动态范围、同步精度均不及 Project Aria 等研究级设备。这可能导致在快速运动或低光照下产生运动模糊与噪声,影响视觉 SLAM 与 3D 重建精度。此外,3D 打印外壳的机械稳定性有限,多次佩戴后立体外参可能漂移,需要频繁重标定,增加了众包场景下的维护成本。
- **数据集场景覆盖与标注深度有限**:虽然提供了 550 小时数据,但全部采集自室内日常环境,缺乏户外、多光线、拥挤动态场景的多样性。自由形式动作字幕虽然开放词汇,但可能缺乏细粒度的时间对齐和对象交互描述;每帧 3D 手部重建由离线方法生成,其准确性受限于设备视角与遮挡,未提供真实手部标定。这使得数据在需要精确对象操纵或人机交互的研究中适用性受限。
- **众包收集的隐私与伦理风险**:第一人称视频极易捕捉到旁观者面部、家庭环境等敏感信息。尽管论文声明了伦理审查和贡献者同意,但设备佩戴者可能在不经意间录制他人私密场景,而开放数据集缺乏实时人脸模糊或自动去标识化机制。在完全开源的环境下,下游使用者可能未严格遵循隐私保护,引发法律与道德争议。