行业新闻

伯克利实现从互联网视频到灵巧手真机部署

伯克利实现从互联网视频到灵巧手真机部署

伯克利使机器人能从网络视频学习灵巧操作,首次打通从互联网到真机的数据链路,大幅降低数据获取成本。

伯克利团队提出 Do as I Do 端到端流程,首次打通从互联网单目 RGB 视频到灵巧手真机部署的完整链路。他们先引导式扩散稳定重建手-物交互的 4D 轨迹,再通过稳健动作重定向(处理噪声参考轨迹)迁移到 22 自由度 Sharpa Wave 灵巧手。在 20 类操作上生成 500 条验证轨迹,并部署 10 个真实任务至双 UR3e 机械臂平台,将重定向成功率从 25% 提升至 71%。

正文摘录

![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg45bedc6226.png) 新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg3b253ef414-62.png) 【新智元导读】 只用单目 RGB 视频,Do as I Do 将日常人类操作转化为 Sharpa Wave 可执行轨迹,补上类人灵巧操作从视频到机器人数据的关键链路。 人类学习灵巧操作,往往是从「看」开始的。 孩子看别人打蛋、倒水、钉钉子,慢慢就能通过模仿学会这些动作。但机器人不一样。今天的机器人学习,更多还是靠「做」,比如成本较高的遥操作、大量仿真执行,或是在精心布置的场景中采集真机数据。 事实上,可供机器人「看」的数据早已存在。YouTube、第一视角数据集以及生成式视频中,已经包含了海量人手与物体交互的素材。真正的瓶颈不在数据缺失 ,而在于是否能完成数据转换:如何把这些带有噪声的单目 RGB 视频,变成多指灵巧手能够执行的动作轨迹? UC Berkeley 团队提出的端到端流程旨在解决该问题, 研究团队跑通了首条能够从网络视频生成真实灵巧手实机执行轨迹的完整链路:先从真实场景中的单目 RGB 视频中重建 4D 手-物交互过程,再将这些交互轨迹重定向到拥有 22 个自由度的 Sharpa Wave 灵巧手上。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-07-07原文

相关内容