行业新闻

ACE-ViDiHand 用视频生成模型实现手部动捕,三大基准拿下 SOTA

ACE-ViDiHand 用视频生成模型实现手部动捕,三大基准拿下 SOTA

不教AI认手,而是从视频生成模型内部直接「读取」手部运动表征,用互联网视频世界先验解决手部遮挡难题。

大晓机器人联合南洋理工大学与上海交大提出 ACE-ViDiHand,首个用视频生成模型做 4D 手部动捕的方法。在遮挡严重时帧准确率 0.997,几乎不丢手。大规模自动标注人类手部视频成为可能。

正文摘录

![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg0d266a50e2.jpg) 新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg3b253ef414-115.png) 【新智元导读】 不教 AI 认手,而是从视频世界模型里直接「读」出双手:三大基准 SOTA,让百万小时野生视频第一次能变成机器人的操作教材。 机器人圈有个老大难问题,卡了所有人好几年: 手部动捕 。 不是捕不了,是一到真实场景就崩——你端碗、拧瓶盖、从口袋掏手机,手一被挡住,最先进的检测器直接报废,后面的姿态重建全盘歇菜。 全世界最聪明的一群人,在这个问题上加检测器、加时序模块、加运动先验、加测试时优化……补丁摞补丁,还是扛不住遮挡。 结果,我们把视频生成模型换了个打开方式,顺手把这事儿办了。 近日, 大晓 机器人 联合南洋理工大学与上海交大发布 ACE-ViDiHand —— 全球首个用视频生成模型做 4D 手部动捕的方法 。 在 ARCTIC、HOT3D、HOI4D 三大基准上,ARCTIC 和 HOT3D 全部九项指标第一,HOI4D 九项中八项第一。 最炸裂的一个数字: 手被东西挡得严严实实的场景下,ACE-ViDiHand 的帧准确率 0.997,此前最强的 WiLoR 只有 0.919。 ![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg55fa8d0572.png) 什么概念?同样跑 1000 帧视频,WiLoR 丢了 81 帧,ACE-ViDiHand 只丢 3 帧——几乎一只手都不落。 这意味着,大规模、高质量的人手视频自动标注,第一次真正成为可能。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-07-14原文

相关内容