东南大学提出 LeaP 可学习先验,改进机器人动作生成
动作生成的起点该是定值还是分布?LeaP 让机器人用自身状态预测一个带方差的起点,仿真成功率比固定高斯起点高 25.5 个百分点。
机器人模仿学习里,扩散模型和流匹配模型靠「迭代去噪」生成动作,通常从与当前状态无关的标准高斯噪声起步。东南大学魏秀参团队提出 LeaP:用机器人自身本体感知信息预测这个起点的均值和方差,让起点随状态变化。在 RoboTwin 15 项仿真任务上平均成功率 81.6%,比同架构的标准高斯基线高 25.5 个百分点,论文被 CoRL 2026 接收。
正文摘录
.jpg)  本文共同第一作者为戴美坡、庄启源、徐赫洋,通讯作者为东南大学青年首席教授魏秀参,研究方向为具身智能、计算机视觉与机器学习。本研究围绕机器人模仿学习与生成式动作策略,探索可学习源分布对机器人操作的作用。 在机器人模仿学习中,扩散模型与流匹配模型将动作生成建模为条件采样,从专家演示中学习动作分布,并通过迭代生成动作序列。这类策略已被用于抓取放置、工具使用与双臂协同等操作任务。 生成式机器人策略通常从与当前观测无关的标准高斯分布出发。A2A、VITA 等方法开始利用本体感知或视觉信息构造生成起点,但主要将起点视为确定性的估计,尚未显式建模其不确定性。这引出了一个问题:动作生成的起点应该是一个确定值,还是一个分布?如果是分布,其方差应该固定,还是随机器人状态变化? 针对这一问题,东南大学魏秀参团队提出 LeaP(Learnable source Prior) ,一种由本体感知信息驱动的可学习源先验。LeaP 联合预测初始高斯分布的均值与方差,为动作生成提供状态相关的随机初始化。