行业新闻

UniTac统一触觉理解与生成架构,让机器人具备触觉预判能力

UniTac让机器人接触前就能预测触觉,统一跨传感器数据,提升VLA在精细操作中的成功率与安全性。

UniTac是优理奇机器人联合多所高校提出的跨传感器触觉架构,统一处理来自不同触觉传感器的数据,同时实现触觉理解和触觉生成。它让机器人能在接触物体前“想象”出触感,从而规划更安全的操作策略,弥补VLA模型在接触密集型任务上的短板。

正文摘录

过去一年,随着具身基础模型的快速发展,机器人已经能完成不少轮廓清晰、位置明确的操作任务。 无论是捏起一颗葡萄而不将它捏破,还是抓住一只纸杯而不让它变形,视觉只能帮助机器人找到目标,想要完成任务,机器人还需要人类与物体交互时不可或缺的触觉感知。 也正因为如此,现在也有越来越多团队开始将触觉作为建构机器人大脑的重要模态。比如,UniTouch、AnyTouch 尝试统一不同传感器的触觉表征,FuSe、Tactile-VLA 把触觉送进通用策略与 VLA,近期的 TacImag 则开始探索让机器人仅凭视觉和本体感觉“想象”触觉;NVIDIA 也推出 TacSL 等视觉触觉仿真工具,加速触觉策略从仿真走向真机。 但这些路线仍各有边界:传感器异构让数据难以互通,触觉理解、生成与动作应用也往往分散在不同模型中。 最近,UniX AI(优理奇机器人)联合浙江大学、麻省理工、牛津、耶鲁以及上海交通大学,发布最新科研成果 UniTac,提出一套统一的跨传感器触觉理解与生成架构,并进一步接入 VLA,为机器人补上了“触觉想象力”。 简单来说,UniTac 让机器人获得了一种 未触先感 的能力,可以让机器人像人一样,在真正碰到物体之前,先“想象”出它摸起来是什么感觉,再决定怎么下手。 这意味着,对于机器人来说,触觉第一次从 “碰到以后才知道”,变成了碰到之前就能预测。 如果把过去几年机器人基础模型的发展,看作一个不断把 AI 锚定到真实世界(grounding)的过程,那么我们大致可以将其分为三层。 VLM(视觉 - 语言模型)完成的是第一层 grounding:把抽象的语言概念对应到现实世界,让机器人知道眼前看到的是什么; VLA(视觉 - 语言 - 动作模型)再往前一步,把视觉语义和语言指令锚定到动作(轨迹),让机器人知道在任务场景时应该规划怎样的轨迹。

阅读原文(qbitai.com)→

行业新闻henry2026-07-18原文

相关内容