论文

PhysBrain 1.5: 从 Vision-Language Models 到 Physical Foundation Models

PhysBrain 1.5: 从 Vision-Language Models 到 Physical Foundation Models

我们提出 PhysBrain 1.5,一个统一模型,能够理解物理环境、生成动作并预测未来状态。受「观察—交互—环境变化」这一物理闭环 的启发,我们将这些能力纳入同一个学习框架。 方法上,我们从通用 vision-language model 出发,将语言回复、end-effector motion 与稠密视觉目标都编码为离散序列,并用自回归 next-token prediction 联合优化。预训练阶段的具身监督完全来自人类交互视频:以任务为中心的 episode 将语义与空间上下文同恢复出的运动及后续观察配对。随后,我们在人类演示、机器人轨迹与模拟经验的混合数据上做supervised fine-tuning。 实验方面,在 28 个具身理解 benchmark 上,我们的 8B 模型平均得分 72.5,刷新开源 SOTA,并与 GPT-6-Astra、Gemini 3.6 Flash 等领先闭源模型持平;在其中 14 个 benchmark 上取得最佳开源结果,同时保留通用多模态能力。 除理解评测外,定性样例显示模型能够输出 end-effector 轨迹,并通过空间对齐的 RGB、depth 与 robot-mask 输出预测未来场景。

论文精读

TL;DR PhysBrain 1.5 将物理环境理解、动作生成与未来状态预测统一进同一自回归框架,从视觉语言模型出发联合建模语言、末端运动与密集视觉目标;8B 模型在 28 个具身理解基准平均 72.5,刷新开源 SOTA 并与 GPT-6-Astra 等闭源模型比肩。

问题

问题背景

当前物理基础模型(physical foundation models)领域关注让单一模型具备 环境理解、动作生成 和 未来状态预测 能力,形成“观察-交互-环境变化”的物理闭环。现有视觉语言模型(VLM)在图像和视频理解上表现强劲,但大多停留在语义层面,缺乏对物理交互和状态演化的建模。

现有方法局限

  1. 任务割裂:动作生成、视觉预测和理解通常由不同架构分别处理,缺少统一的序列建模目标,难以共享表征。
  2. 监督信号利用不足:人类交互视频中蕴含丰富的动作和未来帧信息,但现有方法往往只提取粗粒度语义标签,没有将运动轨迹和后续观察转换为可训练 token。
  3. 开源性能差距:在 embodied understanding 基准上,开源模型与专有模型(如 GPT-6-Astra、Gemini 3.6 Flash)存在明显差距,且缺乏同时输出多模态结果(RGB / depth / robot-mask)的开源方案。

为什么这个问题难/重要

物理世界涉及高维连续状态、时空对齐和因果关系,端到端联合优化要求模型同时建模语言、运动和小视觉 token,训练难度大;真实 robot 数据稀缺昂贵,引入人类视频作为免费监督是可行路径,但需要有效的数据工程;业界对通用具身智能需求强烈,若开源模型能追平专有模型,将显著降低研发门槛并加速迭代。该问题位于视觉、语言、机器人学交叉点,是通往通用物理 AI 的关键瓶颈。

行业类比

类似大语言模型用统一的 next-token prediction 统一了各类 NLP 任务,PhysBrain 1.5 试图用同一个自回归框架统一物理理解、动作生成和未来预测,相当于从“视觉问答”走向“可交互的世界模型”。

核心洞察

  • 将语言、末端执行器运动与密集视觉目标统一编码为离散 token 序列,并在同一自回归目标下联合训练,使单一模型同时具备物理环境理解、动作生成与未来状态预测能力。这一设计突破了传统视觉-语言模型仅输出文本的局限,允许模型直接生成可执行的机器人轨迹和像素级场景预测,并且无需为不同任务设计独立头网络,架构上更简洁、可扩展性更强。
  • 预训练阶段完全依赖人类交互视频,通过任务中心片段恢复运动与后续观测,不引入任何机器人数据即可获得具身监督。相比依赖仿真或遥操作采集的大规模具身数据集,该策略大幅降低数据成本,同时让模型从自然人类行为中学习物理因果与空间交互先验,为后续微调提供了更通用的初始化。
  • 模型将动作轨迹预测与空间对齐的 RGB、深度、机器人掩码输出绑定在同一序列生成过程中,实现了真正的物理世界未来状态预测,而非仅输出文本描述或离散分类标签。这种密集视觉目标生成方式使模型能够预测后续场景的几何与语义结构,为下游规划、控制或仿真提供可直接利用的中间表示,相比现有工作仅输出单模态动作或高层指令更具工程落地价值。

方法

输入与表示

  • 模型以 视觉-语言模型 (VLM) 为基础,接收图像/视频观测与任务指令。
  • 将三类输出统一为离散 token 序列:语言响应、末端执行器运动 (end-effector motion)、密集视觉目标 (dense visual targets,如 RGB、深度、机器人掩码)。
  • 动作延续采用 同质动作延续 (homogeneous action continuation),运动轨迹直接视为 token 序列一部分;视觉目标使用共享的离散视觉表示,并与动作/语言在空间上对齐后联合序列化。

关键模块与训练过程

  1. 统一词汇表与建模目标:构建统一 discrete vocabulary,所有模态 token 共享同一自回归 next-token prediction 目标,避免多任务单独设计损失。
  2. 预训练 (physical-aware pre-training):完全依赖人类交互视频,按 task-centered episodes 提取语义与空间上下文,恢复运动轨迹和后续观测帧,不依赖机器人数据。
  3. 监督微调 (SFT):混合人类示范、机器人轨迹和模拟经验,覆盖 embodied understanding / action / future-state 三类任务。

输出能力

单一模型输出语言回答、末端执行器轨迹、未来场景预测(空间对齐的 RGB、深度、机器人掩码),形成 observation → interaction → environment change 闭环。

与同类工作差异:不是仅在 VLM 上添加动作头或单独预测未来帧,而是将动作、视觉目标与语言统一为同一离散序列并联合优化,从人类交互视频中提取 embodied supervision,使预训练阶段不依赖机器人数据即可获得物理世界先验。

实验

实验设计

在 预训练 阶段,模型完全从 人类交互视频 中获取 embodied supervision,通过以任务为中心的片段,将语义与空间上下文、恢复的动作轨迹和后续观察配对。随后在 人类演示、机器人轨迹、模拟经验 的混合数据上进行 监督微调 (SFT)。评估覆盖 28 个 embodied understanding 基准,并额外测试通用多模态能力,定性展示动作轨迹与未来视觉预测。

关键发现

在 28 个 embodied understanding 基准上,PhysBrain 1.5 (8B) 获得平均 72.5 分,成为开源新 SOTA,其中 14 个基准取得最佳开源结果,整体性能与 GPT-6-Astra 和 Gemini 3.6 Flash 等专有模型相当。同时保留了通用多模态能力。定性实验展示了其生成末端执行器轨迹以及预测未来 RGB / 深度 / robot-mask 的能力。

与基线对比

与分离式 embodied 模型相比,该工作通过统一的离散词汇与自回归目标,将理解、动作、未来预测收敛到同一模型,减少跨模态对齐损失。较之于依赖大量机器人数据的方案,仅用人类视频完成预训练显著降低数据采集成本,对数据稀缺场景的工程落地有直接参考意义。开源模型首次追平头部专有模型的部分指标,也为后续迭代提供了明确基线。

行业影响

落地场景

PhysBrain 1.5 统一了物理环境理解、动作生成和未来状态预测,可落地于:

  • 仓储物流机器人:从视觉感知直接生成抓取/放置轨迹,并预测操作后场景变化,减少分步模型误差。
  • 自动驾驶:同时完成环境理解、路径规划与未来场景预测,替代多个独立模块。
  • 服务机器人:在家庭/商业场景中理解指令、执行动作并预测交互后果,提升任务成功率。
  • 工业自动化:机械臂装配、质检等任务,利用统一的动作和视觉预测,降低编程复杂度。

商业价值

  • 降本:预训练仅依赖人类交互视频,大幅降低高质量机器人数据采集成本;单一模型替代多模型栈,减少训练和推理资源。
  • 增收:提高自动化操作成功率,减少人工干预,提升吞吐量;开源权重降低企业 AI 落地门槛,缩短产品上市周期。
  • 体验提升:模型可预测未来视觉状态,支持预测性维护、实时仿真和更自然的人机协作。

与现有产品/工作流的接口

  • 可作为基础模型嵌入机器人操作系统(ROS 2)节点,通过标准消息接口(如 sensor_msgs/Image, trajectory_msgs/JointTrajectory)输出动作和预测。
  • 提供 Hugging Face 权重和 Evaluation Kit(GitHub),便于微调和评估。
  • 与现有 VLM 流水线兼容,可通过 adapter 接入多模态输入,输出结构化 token 流。

具体 Use Case

  • 电商订单拣选:机器人接收自然语言指令(“拿取红色包装盒”),PhysBrain 1.5 同时输出末端执行器轨迹和预测抓取后的深度/RGB 图像,用于闭环验证,减少掉落和碰撞,提升拣选准确率。
  • 自动驾驶变道决策:输入当前摄像头图像和驾驶意图,模型输出车辆控制轨迹并预测未来几秒的场景,辅助规划器进行安全校验,降低事故风险。

局限

  • 论文对动作生成与未来状态预测仅提供了定性示例,未在标准基准上进行定量评估。这导致无法客观衡量这两项能力与专用动作生成模型或领先专有模型(如 GPT-6-Astra)的差距,也难以判断模型是否真正具备可靠的物理交互与预测能力。后续工作应引入导航、操作等任务的量化指标,并覆盖更广泛的场景与物体类别,以验证泛化性。
  • 预训练阶段的 embodied 监督完全来自人类交互视频,通过逆动力学恢复运动信号,但这类数据缺少真实机器人执行时的接触力、摩擦力、关节力矩等关键物理量。因此模型可能对需要精细力控或复杂接触的任务表现不佳。尽管 SFT 阶段混合了机器人轨迹与仿真经验,但覆盖范围有限,仍存在 sim-to-real 差距,限制了在真实机器人上的直接部署。
  • 模型采用 8B 参数规模,推理时需要同时处理视觉、语言、动作等多个离散序列,计算开销较大。论文未讨论推理延迟、量化压缩或边缘设备部署方案,对于机器人高频控制场景(通常需要数十 Hz 以上的响应频率)可能难以满足实时性要求。此外,模型的自回归生成方式在生成长轨迹或高分辨率未来帧时可能存在累积误差与效率问题。
论文DeepCybo Team2026-09-14原文

相关内容