达摩院 RynnWorld-4D 让机器人同时预测深度与光流
RynnWorld-4D 通过联合生成 RGB、深度和光流,弥合了视频预测与机器人精确操控之间的表征鸿沟。
阿里巴巴达摩院提出 RynnWorld-4D,4D 具身世界模型在生成未来视频的同时预测深度图和光流场,直接输出带几何结构与运动轨迹的 4D 表示。三分支 Transformer 分别处理纹理、几何和运动,并通过联合跨模态注意力对齐,解决 2D 视频缺乏深度、运动场和易产生物理幻觉的问题。
正文摘录
机器人需要「看到三维未来」!RynnWorld-4D 重塑 4D 具身世界模型 - 来源:机器之心 .jpg)  问题背景:2D 视频世界模型的表征局限 近两年,视频生成模型在具身智能领域受到持续关注。从 UniPi 、 SuSIE 到各类 action-conditioned video generation 变体,其核心思路一致:先由模型生成一段未来视频,再从中提取动作信号供机器人执行。 这一范式存在一个长期未被解决的问题 —— 2D 像素预测与 3D 物理世界之间存在本质性的表征鸿沟 。该鸿沟主要体现在三个方面。 其一,2D 视频不包含深度信息 。机器人需要判断目标物体与末端执行器的确切距离(例如 30 厘米或 50 厘米),而纯像素预测只能给出物体在画面中的大致方位,不足以支撑精确操控。 其二,2D 模型缺乏显式的运动场。 像素预测可反映物体发生了位移,却无法给出每个像素在三维空间中的位移方向与幅度,而末端执行器的关节角需从这类三维运动中推导。 其三,缺乏几何约束的视频生成容易产生 “物理幻觉”。 同一物体在相邻帧间出现尺度变化或形状形变,本应发生碰撞的物体互相穿模。