清华与伯克利提出连续时间具身世界模型 ODEWorld
ODEWorld 将机器人的世界模型从离散帧变为连续时间轨迹,能预测两帧之间的动态,并解决表征坍缩问题。
传统视频预测模型按固定帧率学习,难以处理两帧之间的瞬间。清华 AIR 与 UC Berkeley 提出 ODEWorld,让模型学习潜空间速度场(状态随时间的变化率),再通过常微分方程求解器积分出任意时刻的状态,从而支持任意帧率生成、缺失帧还原等任务。它用动态编码器分离静态背景与变化,并直接监督一阶时间导数以避免表征坍缩。
正文摘录
 新智元报道  让机器人把一只虾夹起来,再放进锅里。 真正困难的,可能不是认出虾,也不是找到锅,而是把握夹爪闭合的那个瞬间:早一点,夹爪会落空;晚一点,虾可能已经被推走。夹住之后,机械臂还要连续调整力度、方向和速度。整个过程没有暂停键,也不会等摄像头拍完「下一帧」再继续。 但许多视觉世界模型认识时间的方式,恰恰来自这些被摄像头截取的画面。它们看到第 1 帧、第 2 帧、第 3 帧,并学习如何从一张图跳到下一张图。至于两帧之间发生了什么、换一种帧率后该如何预测,甚至某个关键瞬间缺失后如何还原,模型通常没有一条可以直接查询的连续轨迹。 问题也由此变得具体: 如果机器人对世界的理解只存在于一格格画面里,它要怎样抓住发生在两帧之间的那一瞬间? 来自清华大学智能产业研究院(AIR)与 UC Berkeley BAIR 的研究团队提出了 ODEWorld——全球首个连续时间具身世界模型。它不再只问「下一帧是什么」,而是直接学习世界在每个时刻朝什么方向、以多快的速度变化,并由此还原一条随真实物理时间连续演化的潜空间轨迹。