银河通用发布WAM-TTT框架:借助人类视频实现机器人部署时适应
银河通用提出WAM-TTT框架,首次将测试时训练应用于机器人控制,仅用人类视频即可实现部署时泛化,突破数据成本瓶颈。
银河通用推出全球首个具身智能测试时训练框架WAM-TTT,让机器人在部署阶段仅通过未标注的人类视频即可适应新场景。框架冻结预训练权重,仅更新轻量化快速权重记忆模块,无需昂贵遥操作数据。实验表明,用100条人类视频代替机器人轨迹,任务成功率相当,成本大幅降低。
正文摘录
全球首个!银河通用新框架仅需人类视频即可部署,特斯拉蚌埠住了 - 来源:量子位 要说这两年,大模型最重要的变化之一,就是越来越不依赖预训练一锤定音,部分能力开始留到推理时刻再兑现。 OpenAI o1 如此,DeepSeek-R1 也是如此。模型推理能力提升,靠的是在应用过程中的持续自我提升。 但机器人不一样,它面对的是比文本更复杂的物理世界,任意一次误判都有可能损坏抓取对象。想让机器人像大模型一样在部署时进化,行业内一直没有人做到。 视频链接:https://mp.weixin.qq.com/s/Lwo6wHjR3cYM7ZxbZahXQ 刚刚,银河通用正式发布 全球首个 面向具身智能大模型的测试时后训练框架 WAM‑TTT(World-Action Model Test-Time Training)。 它 首次 将 Test-Time Training(TTT)范式从 NLP 和大语言模型,迁移至物理世界的机器人控制。 不过这里的学习,学的不是具体动作,不是要机器人看一遍视频就学会一个新技能,WAM‑TTT 重在让机器人消化理解当前任务。 它会让机器人先通过人类示范视频充分了解场景信息,再把这些信息写入临时记忆,然后结合原先已有的动作能力完成任务。 一个机器人在训练场里学会了搬箱子,精度、成功率都拉满。可一旦换个环境或者换批箱子,它就立刻摆手不会。 同一项技能,训练时精通,部署时失灵,这就是学术界常说的 部署到真实场景中泛化性衰减。 更麻烦的是,客户每换一个新的部署点位,都得重新采集数据、重新适配模型。整套流程下来又贵又慢,具身智能压根无法规模化落地。 根据官方介绍,它是一套 基于原始人类实拍视频、推理阶段完成适配训练 的 TTT 轻量化框架,低成本且泛化能力强,首次系统性破解了跨场景、高效、规模化部署这道行业难题。