论文

安全动作还不够:面向 Vision-Language-Action 策略的可行未来解码

安全动作还不够:面向 Vision-Language-Action 策略的可行未来解码

安全动作未必可行。冻结的 VLA(Vision-Language-Action)策略可能偏好一个局部可接受的动作,却切断了所有由策略支持、通向安全完成任务的路径。作者将这一现象称为 feasibility-likelihood gap:似然只对下一步动作排序,而可行性取决于该动作留下的未来。 为把「未来」纳入决策,作者推导了受限在安全完成任务条件下的「历史条件策略-环境轨迹律」的精确 next-block marginal,并由此得到一个依赖候选动作的 feasible-future mass:其支撑集记录在冻结的延续过程下安全完成是否仍可能,其大小则度量剩余的安全完成加权质量。由于在线精确求值不可行,作者提出选择性有限候选近似,并给出恢复最优保留可行候选的条件。 在实验上,所提免训练、告警触发的重排序器 VICS-G 在六个 Safety-CHORES 设定上把平均累计安全代价降低 1.9%–57.5%,同时成功率与策略采样相差不超过 2.5 个百分点,平均回合长度相差 0.82 步。 结论:该方法为更安全地完成任务提供了一条有前景且实用的路径——其目标相对于策略是精确的,却无需重新训练策略,也无需在线 rollout。

论文精读

TL;DR 针对 VLA 策略只选局部安全动作却可能堵死后续安全路径的问题,提出可行未来解码 VICS-G,在不重训、不在线 rollout 的前提下评估动作保留的安全完成未来质量,将平均安全成本降低 1.9%–57.5%。

问题

问题背景:机器人视觉-语言-动作(VLA)策略在真实环境中的安全部署成为关注焦点,尤其是冻结的大模型策略在长时程操作任务中如何保证任务完成。

现有方法局限:主流安全机制多聚焦于单步动作的局部约束或似然校正,例如基于 KL 散度的控制正则化、安全层或约束解码。这些方法仅评估当前动作是否“安全”,却未显式推理该动作留下的未来可达空间。对于冻结的 VLA 策略,一个局部无碰撞的动作可能引导至策略支持集外的状态,形成“安全死胡同”(safe dead ends)——后续无论怎样采样都无法完成任务。此外,基于在线 rollout 的可行性评估计算代价过高,无法实时执行,导致实际系统往往退化为短视的贪心选择。

为什么这个问题难/重要:可行性本质上是轨迹级的条件概率性质,需要边缘化未来所有可能策略-环境交互路径。精确计算涉及对历史条件轨迹律的积分,既依赖策略的随机性又依赖环境动力学,通常不可解析。本文推导出精确的 next-block marginal,揭示候选相关的 feasible-future mass,但在线精确评估仍不现实,必须设计有限候选近似。业界对自主机器人安全部署的需求日益增长,训练后无需微调即可提升安全完成率的方法具有重要实用价值,尤其适用于无法重新训练的大规模 VLA 模型。

行业类比:类比于大语言模型解码中的前瞻性策略:不仅当前 token 概率高,还要保证后续序列能生成完整、连贯的回答;类似地,机器人动作选择需要考虑未来可完成的路径质量,而非仅局部似然。

核心洞察

  • 该工作提出决策不仅要看当前动作的安全性,还要看该动作是否保留了未来安全完成任务的可行路径,即“可行未来”视角。与常见的安全层、动作过滤或局部代价惩罚相比,这些方法只判断候选动作本身是否安全,可能选出局部安全但导致死锁的动作。本文通过推导 history-conditioned 策略-环境轨迹律的精确 next-block marginal,并定义 candidate-dependent feasible-future mass,将未来可达性直接集成到解码步骤,弥补了 feasible-likelihood gap。
  • VICS 实现了训练无关的可行未来重排序,在推理时用选择性有限候选近似来估计每个候选的可行未来质量,无需重训策略或在线 rollout。这一设计解决了精确评估在在线环境不可行的问题,同时建立了有限候选下恢复最优可行候选的条件。实验在 Safety-CHORES 上平均降低安全成本 1.9%-57.5%,且成功率仅下降 2.5 个百分点以内,步骤数增加不到 0.82 步,表明该近似在实用性和理论保证之间取得了平衡。

方法

输入

  • 预训练 VLA 策略(冻结)及其生成的候选动作集合
  • 当前观测与交互历史
  • 安全完成约束(任务相关规则或指标)

关键模块

  1. 可行未来边际推导:从历史条件下的策略-环境轨迹分布中,约束到“安全完成任务”子集,推导出下一动作的精确边际。该边际为每个候选动作定义 feasible-future mass:其支持集指示安全完成是否仍可能(即策略是否存在支持路径),其幅度衡量剩余可行质量。精确评估在线代价过高,故转向近似。

  2. 选择性有限候选近似:提出四种近似接口,选择性地评估有限候选,并建立恢复最佳可行候选的条件。避免对所有候选做完整 rollout,降低计算开销。近似包括候选生成、支持估计、幅度估计与干预门控。

  3. VICS-G / VICS-S:

    • VICS-G:通用版本,对可行未来质量做参数化近似,使用连续修正项(continuation correction)估计后续质量,不依赖显式状态符号。
    • VICS-S:符号支持版本,利用任务 grounded 规则判断候选动作的支持集,规则互补提升性能。
    • 执行规则:当检测到当前动作可能导致安全死端时触发干预,用重排后的动作替代原策略输出。

输出

  • 选择具有最高可行未来质量且满足安全完成可能性的动作执行
  • 结果:在六个 Safety-CHORES 基准上,平均累积安全成本降低 1.9%–57.5%,成功率与策略采样接近(差异在 2.5 个百分点内),平均 episode 长度差异 0.82 步以内。

与同类方法的差异:VICS 不依赖 KL 正则或事后概率推断,而是直接优化策略-环境轨迹分布中约束于安全完成的下一动作边际,无需策略重训练或在线 rollout,是一种训练无关的解码时修正方法。

实验

实验设计

在 Safety-CHORES 六个设置上评估 VICS-G,使用 frozen VLA policy 作为基线与 continuation process。VICS-G 是 alarm-triggered、training-free 的 reranker,通过 selective finite-candidate approximation 近似 feasible-future mass,无需在线 rollout 或策略重训。指标包括 mean cumulative safety cost、success rate 和 mean episode length,并与 policy sampling 对比;同时验证 imperfect execution 下的表现。

关键发现

VICS-G 在所有六个设置上降低安全成本 1.9%-57.5%,成功率与 policy sampling 差距不超过 2.5 个百分点,平均 episode length 差距不超过 0.82 步。在执行反馈条件下安全收益仍保持。方法不要求策略重训和在线 rollout,实现了以策略相对目标为基准的实用安全改进。

与基线对比解读

与 policy sampling 相比,VICS-G 将未来可行性纳入决策,避免局部安全但无可行未来的动作。收益幅度在不同设置间差异显著(1.9%-57.5%),反映任务结构与可行未来分布的影响。成功率和步长的接近表明该方法在提升安全的同时未显著牺牲任务完成效率,为部署提供可行路径。

行业影响

落地场景

VICS-G 适用于使用 VLA 策略的机器人控制,尤其是 移动操作 与 自动驾驶决策。典型产品:仓储分拣机器人、家用服务机器人、医疗辅助机器人、L3+ 自动驾驶局部轨迹规划。可作推理时安全后处理,过滤死局/碰撞动作,无需重训。

商业价值

在 Safety-CHORES 六设置下安全成本降低 1.9%–57.5%,成功率持平。核心价值在于降低事故与干预成本,减少硬件损耗、人工接管和停机;方法 training-free 且无在线 rollout,部署成本极低,加速安全合规认证。

与现有工作流接口

以 alarm-triggered reranker 嵌入推理管线:本地安全评估触发告警后,对候选动作做 feasible-future 重排序。封装为标准后处理模块,输入候选动作/观测/历史,输出筛选动作。提供通用 VICS-G 与符号支持 VICS-S 两种接口,可用 gRPC/共享内存集成到 MLflow、Ray Serve 等。

具体落地 use case

  1. 电商仓库分拣:避免机器人进入货架死角,减少人工解救,提升拣选效率。
  2. 自动驾驶路口决策:过滤导致后续急刹车或无法并道的动作,降低安全风险。

局限

  • - **依赖安全代价估计器的准确性与候选集质量**:VICS 重排序依赖预定义的安全代价函数或估计器来判断候选动作的局部安全性及未来可行性。论文附录 D 也讨论了 score error 来源,说明估计误差会影响可行未来质量的计算,可能错误地排除真正可行的候选或保留危险候选。此外,候选动作集合由策略采样和规则生成,若集合不包含足够的可行动作,重排序能力受限。这限制了方法在安全代价难以准确定义或估计的任务中的直接应用。
  • - **实验环境与任务范围有限**:所有评估均在 Safety-CHORES 模拟环境中进行,虽然包含六个设置,但均为桌面操作或导航类任务,且未涉及真实机器人部署中的传感器噪声、延迟或非平稳动态。论文 4.4 提到执行反馈,但实际环境中的不确定性可能放大近似误差。对于更复杂的长期任务或动态场景,有限候选近似和 alarm 门控可能需要重新设计。
  • - **方法引入额外计算与保守性**:为了避免在线 rollout,VICS 采用选择性候选和继续校正,但计算可行未来质量仍需要从局部安全模型和可选 rollout 估计,可能增加推理延迟。同时,alarm 触发的干预可能过于保守,导致在某些情况下拒绝可行的但看起来风险较高的动作,影响任务完成效率。论文提到成功率最多下降 2.5 个百分点,说明存在 trade-off。
论文Tu Nguyen2026-10-06原文

相关内容