行业新闻

机器人操作综述提出新坐标系,厘清 Foundation Model 时代研究版图

这篇综述用“高层规划—低层动作建模—执行控制”三层框架,厘清了 Foundation Model 时代机器人操作研究的不同概念与方法,是该领域的重要知识地图。

机器人操作研究近年涌现出 VLA、Diffusion Policy、Imitation Learning 等大量新概念,但它们其实不在同一个坐标轴上:VLA 解决多模态信息如何进入动作模型,Diffusion Policy 关注动作生成,Imitation Learning 描述从示范学习,LLM Planner 则负责高层任务规划。一篇被 T-RO 接收的综述提出用“高层规划—低层动作建模—执行控制”三层框架重新梳理这些方法,帮助理解每个模型在系统中的位置与作用。

正文摘录

T-RO 综述重构 Foundation Model 时代机器人操作知识版图 ![](https://image.jiqizhixin.com/uploads/article/coverimage/545fb5f3-6977-46c3-8415-2144b754f3fe/016(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 过去几年,机器人操作领域几乎被一批新概念重新 "刷屏"。 LLM Planner、VLA、Diffusion Policy、Flow Matching、Latent Action、World Model、Imitation Learning、Reinforcement Learning…… 越来越多方法被用来描述机器人如何理解任务、感知世界并最终产生动作。 但一个容易被忽略的问题是: 这些概念其实并不处在同一个坐标轴上。 VLA 更多涉及视觉、语言等多模态信息如何进入动作模型;Diffusion Policy 关注动作如何被生成;Imitation Learning 描述模型如何通过示范数据学习;而 LLM Planner 则通常工作在更高层的任务规划阶段。 如果把这些方法简单放在一起比较,就很容易把 "系统层级""模型结构""动作生成方式" 和 "学习策略" 混为一谈。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-04原文

相关内容