机器人操作综述提出新坐标系,厘清 Foundation Model 时代研究版图
这篇综述用“高层规划—低层动作建模—执行控制”三层框架,厘清了 Foundation Model 时代机器人操作研究的不同概念与方法,是该领域的重要知识地图。
机器人操作研究近年涌现出 VLA、Diffusion Policy、Imitation Learning 等大量新概念,但它们其实不在同一个坐标轴上:VLA 解决多模态信息如何进入动作模型,Diffusion Policy 关注动作生成,Imitation Learning 描述从示范学习,LLM Planner 则负责高层任务规划。一篇被 T-RO 接收的综述提出用“高层规划—低层动作建模—执行控制”三层框架重新梳理这些方法,帮助理解每个模型在系统中的位置与作用。
正文摘录
T-RO 综述重构 Foundation Model 时代机器人操作知识版图 .jpg)  过去几年,机器人操作领域几乎被一批新概念重新 "刷屏"。 LLM Planner、VLA、Diffusion Policy、Flow Matching、Latent Action、World Model、Imitation Learning、Reinforcement Learning…… 越来越多方法被用来描述机器人如何理解任务、感知世界并最终产生动作。 但一个容易被忽略的问题是: 这些概念其实并不处在同一个坐标轴上。 VLA 更多涉及视觉、语言等多模态信息如何进入动作模型;Diffusion Policy 关注动作如何被生成;Imitation Learning 描述模型如何通过示范数据学习;而 LLM Planner 则通常工作在更高层的任务规划阶段。 如果把这些方法简单放在一起比较,就很容易把 "系统层级""模型结构""动作生成方式" 和 "学习策略" 混为一谈。