EgoTSR 让 VLM 摆脱时间顺序偏差,准确判断任务推进状态
浙大等团队提出 EgoTSR,用三阶段课程训练让 VLM 判断任务状态而非依赖输入顺序,提升机器人规划可靠性。
视觉语言模型(VLM)常根据图片输入顺序猜测任务进度,而非真正理解状态变化。浙江大学等团队提出 EgoTSR 方法,通过三阶段课程训练和 4600 万条数据,让机器人从第一人称视角判断动作是否促进任务完成,克服时间顺序依赖。
正文摘录
.jpg)  让我们想象一个场景: 机械臂夹起桌上的杯子,正准备把它放进盘子。下一秒,抓取失败,杯子重新掉回桌面。 从时间上看,后一幅画面发生得更晚;但从任务目标来看,机器人不仅没有取得进展,反而退回了原点。人类很容易看出这种变化,视觉语言模型却可能给出相反答案。 原因并不难理解。大量机器人视频都按正常时间顺序记录:先接近物体,再抓取,最后完成放置。在这样的数据里,「后面的画面更接近任务完成」往往成立。模型训练得越久,就越可能记住这条省力的捷径。它能认出杯子、盘子和机械臂,也能描述画面中的动作,却未必真正理解: 这些动作究竟有没有推动任务向前。 针对这一问题, 浙江大学等五所高校的研究团队提出 EgoTSR 。研究从第一人称机器人视角出发,希望让 VLM 学会判断任务状态,并把这种能力进一步扩展到长程规划。团队构建了包含 4600 万条样本的 EgoTSR-Data,并设计了三阶段课程学习流程。