大晓机器人发布 HSImul3R 人–场景交互重建框架,获 ECCV 接收
人类视频里的人–场景交互,能否重建成经得起物理仿真的三维场景、再变成机器人技能?这篇论文给出了首个可仿真框架。
大晓机器人联合南洋理工大学 S-Lab 与上海人工智能实验室发布 HSImul3R,一个面向人–场景交互的三维重建框架,已获 ECCV 接收。它把重力稳定性、真实接触等物理指标纳入评价(以往只看重建得像不像),让结果能直接送入物理仿真,并可迁移到 Unitree G1 人形机器人执行。
正文摘录
.jpg)  一段人坐上椅子的视频,对人类而言再普通不过。我们不仅能看见 "人坐了下来",还天然理解椅子承受人体重量,人与椅面形成接触并最终稳定,这些重力、接触与作用关系共同构成真实世界中的物理交互。但对今天的三维重建系统而言,"看见动作" 与 "重建真实交互" 仍是两回事。一个视觉上准确坐在椅子上的人体,进入物理仿真后,椅子可能因结构缺失倒下,人体也可能与椅面严重穿模。 视觉上成立,并不意味着物理交互上成立。[](https://mp.weixin.qq.com/s/kB0tvAjSPySWPAYx9SGmA) 近日,大晓机器人联合南洋理工大学 S-Lab、上海人工智能实验室发布全新人–场景交互重建研究 HSImul3R,直指三维视觉长期存在的 "感知 — 仿真鸿沟",推动三维重建从 "视觉正确" 走向 "物理可执行"。该成果已被全球计算机视觉顶级会议 ECCV 2026 正式接收。