论文

VisualThink-VLA: 面向高效低延迟视觉-语言-动作策略的视觉中间推理

VisualThink-VLA: 面向高效低延迟视觉-语言-动作策略的视觉中间推理

近期工作开始为 视觉-语言-动作(VLA)策略 配备显式的中间推理能力。然而,在具身控制任务中,文本式的思维链并不适用:不相关或弱文本信息可能干扰动作预测,而自回归文本解码会引入过多延迟,无法满足实时闭环执行需求。 本文提出 VISUALTHINK-VLA,一个面向精确、低延迟 VLA 策略的视觉中间推理框架。其核心理念是通过有效的视觉思维引导动作:VISUALTHINK-VLA 通过一个紧凑的 视觉证据接口 来引导动作预测,该接口保留了空间精度,同时避免了解码开销。此外,为了进一步提升性能和效率,VISUALTHINK-VLA 采用了一种定制的选择性路由机制来学习视觉证据令牌,从而实现低延迟推理并保持高容量专业化。 我们还引入了 VisualEvidence-Kit,这是一个以 VisualEvidence-Agent 为核心的监督与审计资源。该 Agent 构建了包含 754.7k 条 VLA 指令的 VisualEvidence-Set,用于路由监督和反事实忠实度测试。 在多个基准测试和真实机器人评估中,VISUALTHINK-VLA 在大多数基准上取得了最高成功率,同时将推理增强基线原本的多秒延迟降低至亚秒级别。例如,在 BridgeData V2 上,步骤延迟从 ECoT 的 8.377 秒降低至 0.367 秒,实现了 22.8 倍加速。

论文精读

TL;DR VisualThink-VLA 用视觉证据接口替代文本链式思维,配合选择性路由机制,在保持高成功率的同时将推理延迟从多秒降至亚秒级,速度提升 22.8 倍。

问题

问题背景

具身智能中,视觉-语言-动作(VLA)策略 将观测和指令直接映射为机器人动作,但在复杂操作场景(如干扰物分辨、空间关系定位、长期任务跟踪)中,直接预测动作常因缺乏中间推理而脆弱。近期工作开始为 VLA 策略引入显式中间推理,以增强决策可靠性。

现有方法局限

现有推理增强方案多采用文本链式思维(CoT),然而在具身控制中存在根本性不匹配:

  • 信息干扰:机器人观测中的大量空间、动态信息难以用文本完整描述,无关或弱文本表征反而会引入噪声,干扰动作预测。
  • 延迟过高:自回归式文本解码产生秒级额外耗时(如 ECoT 在 BridgeData V2 上单步延迟达 8.377 秒),远超实时闭环控制要求的亚秒级响应,导致策略无法在真实世界中高效运行。
  • 空间精度损失:文本序列天然丢失连续空间细节,影响精确操控。

为什么这个问题难/重要

该问题的核心挑战在于推理质量与推理速度的矛盾:要保留空间精确的推理证据,又要避免文本解码带来的延迟瓶颈。若无法解决,推理增强 VLA 只能停留在仿真或离线场景,难以部署到实际机器人系统。业界对低延迟、高成功率的 VLA 策略有迫切需求,尤其是在精细操作、动态环境交互等任务中,实时性直接决定任务成败。

行业类比

该问题类似于自动驾驶中的感知-规划链路:必须在毫秒级完成障碍物检测与轨迹生成,任何秒级推理延迟都可能导致安全事故,因此需设计紧凑的中间表征而非冗长文本描述。

核心洞察

  • 视觉中间推理替代文本链式思维是具身控制中更本质的提速方向:文本推理不仅因自回归解码引入多秒级延迟,更会将弱相关语义噪声注入动作预测,而 VisualThink-VLA 将推理过程压缩为空间精确的视觉证据接口,直接从视觉特征图生成低维引导 token,避免生成文本再解析的周转,在 BridgeData V2 上将步延迟从 ECoT 的 8.377 秒降至 0.367 秒,证明视觉原生推理在闭环控制中可同时提升效率与准确性。
  • 选择性路由机制通过任务自适应门控仅激活部分视觉证据 token,打破了固定全量推理的延迟瓶颈:与常见的一次性生成所有思考 token 的方法不同,该策略学习何时及哪些视觉位置需要更高容量处理,在维持复杂场景高性能的同时省去冗余计算,实现了次秒级推理且不牺牲成功率,为部署资源受限的真实机器人提供了可学习的复杂度分配范式。

方法

VisualThink-VLA 为 VLA 策略引入视觉中间推理,其处理流程从多模态输入(RGB 观测 + 语言指令)开始,经过三个关键模块生成动作:

视觉证据接口 (Channel Evidence Interface)

此模块将视觉特征压缩为一组紧凑的视觉证据 token,这些 token 保持空间精度,避免文本链式推理的冗余解码。每个 token 代表图像中与任务相关的区域或属性,为后续动作预测提供稀疏但高信息密度的中间表示。

选择性路由机制 (Selective Routing)

路由器对每个视觉证据 token 进行二值决策(参与/跳过),仅保留对当前动作最关键的 token 参与后续计算。该机制通过可学习门控实现,兼顾高容量表征与低时延推理,是 speedup 到亚秒级(0.367 s/步,BridgeData V2)的核心。

视觉状态组合器 (Visual State Composer)

融合历史观测与当前帧,生成时序一致的状态表示,并注入任务上下文,以支撑长周期任务中的空间推理。

训练时使用 VisualEvidence-Kit:其内置 VisualEvidence-Agent 自动构建 754.7k 条指令的 VisualEvidence-Set,提供路由监督并执行反事实忠实度测试,确保视觉证据真正关联动作而非虚假相关。最终,动作预测与路由决策被端到端联合优化。

文本链式思维 VLA(如 ECoT)的关键差异在于:VisualThink-VLA 完全避开自回归文本解码,通过视觉 token 直接驱动动作,在保持空间精度的同时消除了多秒级延迟,实现 22.8 倍加速。

实验

实验设计

在多个仿真基准和真实机器人平台上评估 VisualThink-VLA,重点对比推理增强型 VLA 基线(如 ECoT)。主实验覆盖 BridgeData V2 等具身操控数据集,记录任务成功率和每步推理延迟。

关键发现

  • 延迟大幅压缩:在 BridgeData V2 上,将推理步延迟从 ECoT 的 8.377 s 降至 0.367 s,提速 22.8 倍,进入亚秒级实时闭环。
  • 成功率保持领先:在多数基准上取得最高成功率,证明视觉中间推理并未牺牲决策质量。
  • 视觉证据有效性:通过紧凑的视觉证据接口保留空间精度,避免文本链式推理的无关信息干扰和自回归解码开销。

基线对比解读

ECoT 等文本中间推理方法相比,VisualThink-VLA 的延迟优势源于抛弃了自回归文本解码,改用一次性的视觉 token 路由。Task-Adaptive Orchestration 选择性激活视觉证据通道,在简单场景不引入额外计算,而复杂场景保持高容量,实现了效率与精度的动态平衡。这为实时机器人操控提供了新的范式:视觉思考比文本思考更适合闭环动作生成

行业影响

落地场景

VisualThink-VLA 所代表的视觉中间推理框架,为机器人操作、自动驾驶、AR/VR 交互、工业巡检等需要实时闭环控制的具身智能场景提供了新的技术路径。在电商仓储的柔性抓取、物流分拣中,机器人需快速理解视觉场景并执行精确动作,该框架可将推理延迟从秒级降至亚秒级,显著提升任务节拍。在内容平台的视频理解与交互式推荐中,视觉证据 token 可作为可解释中间表征,用于动作定位或内容审核。此外,医疗手术机器人、远程操控等对低延迟和高空间精度要求苛刻的领域,也能受益于 Channel Evidence Interface 对空间信息的保持。

商业价值

延迟的降低直接转化为产能提升:以仓储机器人为例,假设每步动作节省 8 秒,每日数万次操作可累计节省数十小时,人力与设备摊销成本显著下降。22.8 倍加速(从 8.377s 降至 0.367s)使原本离线批处理的推理任务可转为在线实时执行,拓展了 VLA 在动态环境中的可用性。高成功率意味着更少的异常人工干预,降低运维成本。对产品体验而言,更低的响应延迟带来更流畅的人机协作,增强客户信任。此外,VisualEvidence-Kit 提供的可审计性和反事实保真度测试,为高风险应用(如医疗、金融风控)提供了合规抓手,降低部署风险。

与现有产品 / 工作流的接口

该框架可与现有 VLA 堆栈无缝集成:

  • 模型层:支持直接替换现有 VLA(如 RT-2、OpenVLA)的推理头,通过 selective routing mechanism 在原有视觉编码器与动作解码器间插入轻量的视觉证据分支。
  • 数据飞轮VisualEvidence-Agent 可接入现有数据标注管线,自动构建视觉证据训练集,无需全人工标注。
  • 部署:推理时可按需激活路由,兼顾高精度与低延迟,便于在边缘设备上通过模型量化/剪枝进一步压缩。

具体落地用例

  1. 电商仓储机器人:在动态货架拣选场景中,机器人需从杂乱的料箱中识别目标并规划抓取。VisualThink-VLA 将视觉推理空间化,直接输出抓取点热力图,避免文本 CoT 带来的秒级延迟,使机器人能以接近人类的节拍连续作业。
  2. 自动驾驶数据标注与仿真:在环视相机输入下,车辆需理解交通标志与移动障碍物的空间关系。利用视觉证据界面生成中间特征,可同时用于动作预测和场景解释,提升仿真测试中模型行为的可解释性,加速安全验证闭环。

局限

  • **对构造数据集的依赖性**: VisualEvidence-Kit 通过 VisualEvidence-Agent 自动构建视觉证据,其覆盖范围与标注质量直接影响路由学习及反事实测试的可靠性。在分布外场景下,自动生成的视觉证据可能出现偏差,导致推理错误。合成数据的固有缺陷可能限制模型在真实复杂环境中的泛化能力,尤其是在需要常识或物理推理的任务中。
  • **视觉推理的可解释性不足**: 虽然视觉证据保留空间精度并降低延迟,但与文本思维链相比,其在人机协作场景中的可解释性较弱,工程师很难直观审计推理过程。论文提供的 faithfulness 审计仅部分缓解该问题,在安全敏感领域(如医疗辅助、精密制造)仍可能因缺乏可读推理路径而难以被采纳。
  • **训练开销与任务范围有限**: 选择性路由机制引入额外训练监督,且模型需针对不同机器人形态进行适配。当前实验主要覆盖抓取与放置类基准,对于高动态环境、精密接触式操作或长序列任务,视觉证据的有效性和路由策略的鲁棒性尚未充分验证。模型在物理交互更复杂场景下的性能边界仍不明确。
论文Mingjian Gao2026-05-28原文

相关内容