ReactHuman: 面向具身多模态 LLM 类人反应式决策的物理基础基准
接住滑落的盘子、躲开掉落的刀这类突发物理危险 反应,既是对具身智能有意义的检验,也是把 MLLM 用作家用机器人决策核心的硬性要求。但现有评测要么以视频问答被动考察直觉物理,要么面向导航、重排等需反复权衡的长时程任务,尚无基准 衡量模型能否把物理理解转化为即时、安全攸关的动作。 为此,我们提出 ReactHuman:首个物理基础的类人反应式决策基准。被评测的 MLLM 充当模拟人形机器人的大脑,应对突发的家用危险,覆盖 17 个事件家族 与 1,000+ 个逐位可复现场景;真值由 240 Hz 刚体仿真导出,精确且无需人工标注,并包含外观与物理相悖的对抗物体(泡沫铁砧、钢苹果)。我们还设计五项指标,从合理、安全、物理 grounded 三个轴向为每次反应打分,并物理执行每一个被采纳的计划,使决策具有可观测后果。 基于该评测框架,我们测试了七个代表性 MLLM,结果显示反应式安全远未解决:模型大约每三个危险就有一个处理失当,依据固定倾向而非观测到的场景行动,信任外观甚于运动,即使所选动作正确也会在米级尺度上错过拦截点;这些失败并不随模型规模增大而缓解。ReactHuman 因此为迈向物理 grounded、安全可感知的具身智能体提供了细粒度诊断与可扩展的训练信号。
论文精读
TL;DR ReactHuman 是首个物理仿真基准,让多模态大模型作为人形机器人“大脑”应对突发家庭危险,用 240Hz 刚体仿真和五个指标实测七款模型,揭示模型每三个危险就有一个处理不当且不随规模改善。
问题
问题背景:具身智能正推动 MLLM 成为家用机器人的决策核心,要求模型在动态物理环境中实时感知并输出安全动作。
现有方法局限:
- 被动视频问答(如 IntPhys、CLEVRER)只测试直觉物理理解,不生成可执行动作。
- 长程规划基准(如 ALFRED、BEHAVIOR)侧重高层任务分解,忽略毫秒级突发反应与物理执行后果。
- 缺少物理执行闭环,无法观察决策在模拟环境中的实际效果;场景缺乏对抗性设计,外观与物理属性不一致的物体(如泡沫铁砧、钢铁苹果)未被考虑。
为什么这个问题难/重要:从视觉到安全动作的闭环要求模型在极短时间内完成时空推理、物理预测与动作生成,实时性约束严格;安全关键场景(接住滑落盘子、躲避掉落刀具)不允许试错。业界对人形机器人安全部署高度关注,缺乏可靠的即时反应能力是主要落地瓶颈。
行业类比:类似自动驾驶中的紧急避障,需要感知-决策-执行的超低延迟闭环,任何环节失误都可能造成严重后果。
核心洞察
- - ReactHuman 的核心创新是把物理理解转化为可执行的即时反应动作:在 240 Hz 刚体模拟器中执行每个救险计划,获得无标注精确真值。区别于视频问答式被动评测和长程任务规划,该基准强制模型从视觉观测直接产生安全关键动作,从而暴露静态评估看不到的问题——约三分之一危险被错误处理,且失败率不随模型规模下降。这表明反应式安全是独立于语言推理规模的能力瓶颈。
- - 对抗性外观-物理探针(如泡沫铁砧、钢制苹果)分离了外观和运动两类线索。现有基准中物体外观与物理属性通常一致,模型可靠视觉识别通过。该设计迫使模型用观测到的运动覆盖语义先验,实验显示模型普遍信任外观胜于运动,甚至基于固定行为倾向而非场景动态行动。这为具身智能提供了更精准的诊断维度。
- - 五指标评估体系(合理、安全、物理接地)中的 Physical Endpoint Distance 和 Hand-Distance Evolution 提供了连续、细粒度诊断,远超二元成败。结合模拟器无标注真值,该指标体系能生成可扩展的密集训练信号。同时揭示即使动作选择正确,模型仍可能在米级尺度错过拦截点,区分了高层规划与低层控制错误。
方法
Freeze-and-Predict 协议
ReactHuman 采用 Freeze-and-Predict 协议:MLLM 在观测到突发物理危险场景的“冻结”视觉帧后,必须输出一个即时动作计划(如抓取、闪避),随后由 240 Hz 刚体仿真器物理执行该计划,产生可观测后果。
输入 → 关键模块 → 输出
1. 场景生成与真值标注
- LLM 语义规划:用 LLM 生成 17 个突发事件族 的自然语言描述(如盘子滑落、刀具掉落、物体坠落)。
- 种子随机化:基于种子随机化刚体的位置、速度、材质等参数,生成 超过 1,000 个 可 bit-for-bit 复现场景。
- 仿真标注:在刚体仿真中自动生成精确、无人工标注的真值标签,包括物体运动轨迹、安全拦截点等。
- 对抗性探针:引入外观与物理属性冲突的物体(如 泡沫铁砧、钢苹果),检验模型是否依赖外观而非运动信息。
2. 人形机器人执行
- 将 MLLM 输出的语义动作映射为具体关节运动,在仿真环境中实时执行。动作空间包括手部抓取、身体闪避等。
- 所有承诺的计划都被物理执行,保证决策有可观测后果,避免“纸上谈兵”。
3. 五指标评估套件
- SAA(语义动作准确率):动作类型是否正确。
- Safety Validity:是否避免伤害或减少碰撞风险。
- Physical Endpoint Distance:手部末端与目标拦截点之间的物理距离误差。
- AIA(动作-意图对齐):模型内部推理与输出的动作是否一致。
- HDE(手部距离演化):整个反应过程中手部与危险物体距离的变化曲线。
输出与特点
每个场景输出一个由五项指标构成的诊断向量,同时暴露模型在安全、物理合理性、意图一致性上的具体缺陷。与现有被动视频问答或长程导航基准不同,ReactHuman 首次要求模型将物理理解转化为即时、安全关键的具身动作,并可直接作为强化学习或偏好优化的训练信号。
实验
实验设计
ReactHuman 采用 Freeze-and-Predict 协议:给定突发的家居危险场景(如滑落的盘子、坠落的刀具),MLLM 在冻结的时间窗口内观察视觉输入,从预定义动作空间中选择一个高层指令(如 catch、dodge、block),由控制器在 240 Hz 刚体仿真中执行。评估覆盖 17 个事件家族、超过 1000 个可逐位复现场景,包含外观与物理性质相悖的对抗物体。使用 5 个指标:SAA、Safety Validity、Physical Endpoint Distance、AIA、HDE,衡量合理、安全与物理 grounded 三个轴,并实际执行每个决策以观察后果。对 7 个代表性 MLLM 进行推理评估。
关键发现
约 1/3 的危险处置失败;模型常基于固定行为倾向而非观察到的场景;过度信任物体外观而非运动学;即使动作选择正确,也常在米级尺度上错过拦截点;且这些缺陷不随模型规模增大而缩小。
与基线/同类工作的差异
无同类主动反应基准可比。与被动视频 QA 类基准对比,ReactHuman 首次将直觉物理转化为即时安全动作并测量可观测后果,揭示从物理知识到执行之间的实质缺口。其对工程启示:部署家用机器人时,不能仅依赖模型规模,需增加在线运动感知与执行校验。
行业影响
落地场景
ReactHuman 面向 人形机器人 / 家用服务机器人 的安全决策评估,也适用于 自动驾驶紧急避障、工业协作机器人 与 AR/VR 物理交互。产品团队可将其嵌入机器人操作系统或云端决策模块的回归测试,筛选安全可靠的 MLLM 决策核心。
商业价值
该基准对齐 安全合规 与 部署信任:降低真实环境事故率,减少产品召回与责任风险;全仿真 + 精确标注替代人工标注,缩短迭代周期。对机器人公司可作为模型选型与版本发布的 质量门禁,提升 B 端客户信任,加速商业化落地。
与现有工作流集成
ReactHuman 可挂接 NVIDIA Isaac Sim / MuJoCo 等物理引擎,通过 API 批量运行场景并返回五维指标。在 ML pipeline 中可作 CI/CD 回归测试 或 数据飞轮:失败案例自动生成微调数据,用于 RLHF / SFT 强化安全决策。
具体落地 use case
- 自动驾驶:利用 adversarial objects(泡沫铁砧、钢苹果)测试多模态模型在视觉外观与物理属性冲突时,能否做出正确刹车 / 转向决策。
- 电商仓储机器人:基于
freeze-and-predict协议评估机器人突然遇到掉落包裹时的规避动作,减少分拣中心碰撞停机时间。
局限
- **模拟与现实差距**:ReactHuman 基于 240 Hz 刚体模拟,提供了可控且可复现的环境,但模拟器无法完全捕捉真实世界的物理不确定性、传感噪声、执行器延迟及复杂接触动力学。例如,粘滑摩擦、柔性物体变形、多体碰撞后的能量耗散等难以精确建模,导致模型在基准中的表现可能高估其在真实家庭环境中的安全性。此外,模拟人形机器人的动作空间(如关节速度限制、灵巧手抓取)经过简化,与真实硬件存在差距,基准结论需通过实机实验进一步验证。
- **任务覆盖的单一性**:基准聚焦于“突发物理危险”的反应性决策,这是具身智能的一个关键但狭义的子能力。它不评估模型在长时程任务规划、多步操作、人机交互或社会规范遵循等方面的表现。现实中的家庭机器人需要在反应式控制和目标导向行为之间无缝切换,而 ReactHuman 仅测试了前者的即刻响应,可能无法全面反映 MLLM 作为通用具身决策核心的完整能力。此外,17 个事件家族虽然多样,但仍未覆盖所有可能的家庭危险(如电气火灾、液体泼溅后的湿滑地面等)。
- **对抗性物体与模型评估的局限**:论文通过“泡沫铁砧、钢苹果”等外观-物理矛盾物体测试模型是否信任外观,但仅两类对抗性材质可能不足以系统性刻画模型的归纳偏差。更丰富的材质、形状、密度组合(如透明重物、空心铁块)能更全面暴露视觉语言模型在物理推理上的缺陷。另外,评估的七个 MLLMs 虽然涵盖不同规模,但未能包含所有主流架构(如专有闭源模型的最新版本),且控制器设计(将计划转化为动作)可能引入额外偏差,影响对模型原始决策能力的归因。