唤醒触摸!MLLM 中的掩码隔离触觉对齐学习
触觉提供了感知材料固有属性(如摩擦和顺应性)所需的物理基础,而这些单凭视觉往往难以分辨。然而,近期为多模态大语言模型(MLLMs)配备触觉感知的努力暴露出一种零和博弈:紧凑模型的有限参数预算迫使在获取新感官模态与保留已有视觉-语言推理能力之间做出取舍。 我们提出 Splash,一种用于 MLLMs 的掩码隔离触觉对齐学习框架。Splash 量化每个预训练参数的重要性,并将参数空间划分为休眠子空间与关键子空间。冻结的关键子空间作为稳定锚点保护通用视觉知识,而 Splash 更新隔离的休眠子空间,将触觉对齐内化至 LLMs。这种选择性、非破坏性的扩展有效防止灾难性遗忘,确保模态扩展的非破坏性。 大量实验表明,Splash 在不增加 LLM 部分推理开销的情况下有效实现了触觉推理,在包括 SSVTP、TVL 和 TacQuad 在内的视觉-触觉基准上达到最先进性能,同时保留了原有的通用能力。
论文精读
TL;DR Splash 通过掩码隔离,仅更新预训练参数的休眠子空间来学习触觉对齐,使多模态 LLM 在保持视觉语言能力的同时获得触觉感知,超越现有基准并避免灾难性遗忘。
问题
问题背景
多模态大语言模型(MLLMs)正从纯视觉-语言交互迈向更全面的物理感知,触觉作为核心感官之一,能提供视觉无法分辨的材料内在属性(如摩擦、柔顺性),在具身智能任务中不可或缺。
现有方法局限
近期为 MLLMs 融入触觉的工作暴露了一个零和权衡:紧凑模型的参数预算有限,若直接微调(full fine-tuning),会引发灾难性遗忘,严重损害已建立的视觉-语言推理能力;若采用传统参数高效微调(如 LoRA),由于触觉对齐需要跨模态构建新的表征,低秩适配往往不足以充分学习,或在共享参数空间中与原有视觉知识产生干扰,导致新旧任务均难达最优。本质上,这些方法未能解耦新旧知识在参数空间中的依赖,只能被动牺牲一方的性能。
为什么这个问题难/重要
触觉对齐的关键难点在于:1)触觉数据具有高维时空特性且采集成本高;2)对齐过程需要重塑模型的内部表征,极易扰动对视觉世界的理解;3)部署侧要求不增加 LLM 推理开销,限制了引入额外模块的空间。业界对可成长的多模态基础模型需求迫切,若能以无损方式扩展新模态,将直接赋能机器人精细操作、材质识别等物理交互场景,推动通用智能体发展。
行业类比
如同为预训练视觉问答模型无缝集成触觉传感器数据以提升机器人抓取成功率,必须确保图像理解不掉点,这一挑战在多模态系统向物理世界延伸时具有普遍性。
核心洞察
- 通过量化预训练参数重要性将模型划分为‘休眠’子空间和‘关键’子空间,Splash 实现了非破坏性的触觉模态扩展。与直接全量微调或 LoRA 等低秩适配方法不同,这种选择性微调冻结视觉-语言推理相关的关键参数,仅在休眠子空间引入触觉对齐,从根本上避免了灾难性遗忘,解决了现有紧凑型 MLLM 在增加新模态时面临的能力取舍困境。
- Splash 在推理阶段不引入任何额外计算开销,因为触觉知识被直接融入 LLM 原有参数中,而不依赖外部适配器或辅助网络。这对于资源受限的具身智能场景尤为重要,现有方法如记忆增强或侧网络会带来额外延迟和存储成本,而 Splash 的结构性更新在保持原有推理效率的同时实现了触觉理解能力的整合。
- ‘休眠子空间’概念揭示了预训练模型中存在大量对特定任务非关键的冗余参数,这一发现可推广为一种通用多模态持续学习策略。通过动态识别和隔离不同模态的关键区域,有望在单模型内逐步扩展视觉、触觉、乃至更多物理传感器数据,实现真正无缝的具身多模态融合,为构建通用物理智能提供新的参数更新框架。
方法
输入与问题设定
Splash 面向 视觉-触觉-语言(VTL)对齐,输入包含 图像(视觉)、触觉序列(如 GelSight 信号) 和 文本指令 / 问题,目标是在已预训练的 多模态大语言模型(MLLM) 基础上新增触觉理解能力,同时避免覆盖原有的视觉-语言(VL)知识。
关键模块:掩码隔离的触觉对齐学习
Splash 将参数高效微调与剪枝思想融合,形成 非破坏性模态扩展 范式,核心流程如下:
参数重要性评估
对预训练 MLLM 中的每个参数,基于其梯度或权重幅值计算 重要性分数,量化该参数对原有 VL 任务的贡献。子空间划分
根据重要性分数将参数空间分为两部分:- 关键子空间(critical subspace):重要性高的参数,作为视觉知识的稳定锚点,完全冻结。
- 休眠子空间(dormant subspace):重要性低的参数,允许更新以吸收触觉模态。
掩码隔离训练
在触觉对齐阶段,仅对休眠子空间施加梯度更新,关键子空间保持冻结。训练使用标准的下一 token 预测(language modeling loss),但梯度传播被二进制掩码限制在休眠参数内。这相当于在参数层面实现 选择性的 “苏醒” 触觉通路,而不扰动已建立的 VL 推理链路。自适应稀疏分配(可选)
通过动态调整休眠子空间的稀疏度(如基于任务难度或触觉数据量)进一步提升稳定性与效率。
输出与效果
框架输出一个 单一、无额外推理开销的 MLLM,无需添加适配器模块或改变模型结构。在 SSVTP、TVL、TacQuad 等 VTL 基准上达到 SOTA,同时原始 VL 任务(如图像问答)性能不降级。
与同类方法的差异
不同于 LoRA 等添加旁路参数的方法,Splash 直接在原参数空间内部挖掘冗余容量,通过重要性驱动的掩码实现模态隔离,既避免了解耦模块带来的推理延迟,也从根本上缓解了全量微调引发的灾难性遗忘。
实验
实验设计
- 任务与基准:在三个视觉-触觉-语言 (VTL) 对齐基准上评估:SSVTP、TVL 和 TacQuad,覆盖触觉推理、属性匹配等任务。
- 基线:与多种多模态 LLM 适应方法对比,包括全参数微调、LoRA 等参数高效微调,以及直接模态扩展方法。重点考察灾难性遗忘和视觉语言能力保留。
- 评估维度:触觉任务准确性、原始视觉语言推理保留度(通过保留基准测试),以及推理开销。
关键发现
- Splash 在所有 VTL 基准上取得最优表现,显著超越现有方法,同时无额外推理开销(LLM 部分)。
- 通过掩码隔离的触觉对齐学习,Splash 在更新休眠子空间时冻结关键子空间,成功防止了灾难性遗忘。
- 保留实验显示,Splash 在视觉语言任务上的性能与原始多模态 LLM 几乎持平,而全参数微调等基线均出现明显遗忘(例如视觉问答准确率下降 > 10%)。
与基线的对比解读
- vs. 全参数微调:全量更新导致视觉特征严重退化,Splash 的选择性扩展避免了这种竞争。
- vs. LoRA / 参数高效方法:虽然 LoRA 能减少遗忘,但触觉对齐性能不足;Splash 通过参数重要性度量精准定位可训练空间,同时实现高对齐精度和保留度。
- 实际工程启示:该框架为多模态 LLM 的无损模态扩展提供了新思路——无需牺牲已有能力,即可集成触觉等新感官,对机器人灵巧操作等应用有直接价值。
行业影响
触觉增强 MLLM 的工业落点
Splash 提出了一种参数隔离式触觉对齐方法,使多模态大模型能够在保留视觉语言推理能力的同时,高效融入触觉感知。这一特性直接降低了具身智能系统引入新模态的灾难性遗忘风险与计算开销,为依赖精细物理交互的产品开辟通路。
落地场景
- 机器人灵巧操作:在物品分拣、易碎品抓取等场景中,触觉可提供摩擦力、软硬度等关键信息,弥补视觉盲区。Splash 可在不牺牲通用视觉理解的前提下,为机械臂注入触觉推理能力,适配仓储物流自动化、医疗手术辅助机器人等对安全性和柔顺性要求高的领域。
- 交互式内容平台:电商平台或虚拟试衣间可利用触觉-视觉对齐模型生成更真实的材质触感描述,提升线上购物体验;游戏/元宇宙中则可驱动触觉反馈设备,增强沉浸感。
- 自动驾驶与特种巡检:路面湿滑度、积雪或泥泞检测等任务可受益于触觉-视觉融合,提升极端环境下的决策鲁棒性。
商业价值
- 降低多模态模型训练与维护成本:Splash 仅更新休眠参数子集,避免全量微调,且不影响原有视觉能力,企业无需为每个新模态重新训练或部署独立模型,有效节省计算资源与数据采集开销。
- 提升产品差异化与用户体验:在配送机器人、智能假肢、触觉反馈手套等产品中,更精准的触觉推理可转化为更高的任务成功率与用户信任度,形成直接竞争优势。
- 解决多模态扩展的瓶颈:传统方法常在新模态与旧能力之间做零和博弈,Splash 的非破坏性扩展方式使产品迭代周期大幅缩短,加快技术商业化进程。
与现有工作流的集成接口
Splash 可直接作用于主流视觉语言模型(如 LLaVA 等),通过参数重要性评分与掩码隔离自动找出可安全更新的子空间,无需修改模型架构或推理管线。集成方式:
- 基于现有 MLLM checkpoint,运行重要性分析以确定休眠子空间;
- 使用少量触觉-视觉-语言对齐数据,仅训练休眠参数;
- 将更新后的参数融合回原模型,推理时无需额外模块或增加延迟。
该流程可嵌入现有 MLOps 工具链,作为模型扩展的标准化步骤。
具体使用案例
- 全球电商仓库自动化:物流机器人利用视觉识别货品类别,同时通过触觉判断包装材质与握持力度。Splash 使同一模型既能回答“这是什么物体”,又能推理“表面是否光滑”,减少抓取失误带来的货损成本。
- 跨国手术机器人公司:手术器械需具备极致的力反馈精度。使用 Splash 在术前规划视觉模型基础上增加触觉对齐,可在不破坏已校准的视觉导航能力下,快速适配新触觉传感器,缩短产品临床部署周期。
局限
- **静态子空间划分依赖阈值调优**:Splash 通过重要性分数将参数静态二分为休眠与关键子空间,划分质量高度依赖于稀疏度阈值的选择。阈值需针对不同基座模型与模态组合重新调整,缺乏自适应机制,调参成本较高。此外,实验仅在小规模 MLLM(如 1B 参数级别)上验证,更大模型可能因参数冗余度降低而难以找到足够的休眠子空间,方法的可扩展性未得到检验。
- **触觉数据与评估场景受限**:实验基于 SSVTP、TVL、TacQuad 等有限规模的 visuo-tactile 基准,这些数据集覆盖的材质、传感器类型和交互模式较窄,可能无法代表真实机器人操作中的复杂性与多样性。方法未经过跨传感器、跨具身环境的泛化测试,对齐质量还受制于上游触觉编码器的性能,若编码器提取的表示不佳,下游效果将受到拖累。
- **训练过程开销与连续扩展未明确**:尽管推理阶段无额外开销,训练时需要计算参数重要性、生成掩码并维护双空间的前向/反向传播,训练时间和内存占用高于直接全量微调或 LoRA 等轻量方法,论文未对此进行定量对比。对于未来连续增加更多模态(如听觉、力觉),如何累积划分参数空间仍面临长期遗忘风险,当前框架尚不支持增量式的多模态扩展。