置信度感知的工具编排用于鲁棒视频理解
视频推理语言模型隐式假设所有输入帧同等可靠,导致盲信问题(Blind Trust Problem):在运动模糊、眩光、遮挡等现实扰动下,前沿视频推理模型准确率下降15–30%,且无法察觉视觉证据退化。 为解决此挑战,我们提出Robust-TO,一种将每帧可信度显式集成到推理各阶段的智能视频理解框架。Robust-TO通过统一证据接口组织多种视觉感知工具:每个工具接收原始问题派生的子查询和由可靠性-相关性分数(reliability-relevance score) 选取的可信帧,返回统一格式证据——具体预测(如边界框、运动轨迹、识别文本或动作标签)、时间定位和校准置信度分数(calibrated reliability score)。推理时,这些校准分数通过三层次综合过程(高/中/低) 指导证据加权,并定义置信度-代价GRPO奖励,联合优化正确性、证据可靠性与效率。 在两个视频推理基准的八项任务上,Robust-TO在干净输入上取得56.4% 平均准确率,超过最强开源基线10.6个点,并优于Gemini-2.5-Pro(46.2%)。在五种现实损坏类型下,Robust-TO保持54.3% 平均准确率,高出最强开源基线5.8个点,且准确率下降幅度为所有方法中最小。
论文精读
TL;DR Robust-TO 引入逐帧可信度评估与多工具证据融合,解决视频推理中因盲信帧质量导致的准确率崩溃,在多种真实扰动下保持鲁棒性,显著超越最强基线及 Gemini-2.5-Pro。
问题
问题背景
视频推理语言模型(如 GPT-4V / Gemini 等)正在快速进入具身智能、视频问答、机器人操作等现实场景,其核心能力是基于视觉输入进行时序理解和决策。当前主流范式默认所有输入帧提供同等质量的证据,模型对每一帧“一视同仁”。
现有方法局限
该领域存在一个被忽视的盲信问题 (Blind Trust Problem): 现有模型缺乏对帧级可信度的感知与响应机制。实验表明,在常见干扰(运动模糊、眩光、遮挡)下,前沿模型的准确率会骤降 15–30 个百分点,且模型对自身的视觉证据退化毫无察觉**,仍会基于劣化帧给出高置信但错误的推理。这暴露了三个技术局限:
- 无帧级质量评估: 端到端模型未显式建模每帧的信息可靠性,无法区分清晰帧与受损帧。
- 证据融合固定: 所有帧以均匀或学得的静态权重参与推理,没有动态调整证据贡献的机制。
- 缺乏显式不确定度: 模型输出无法追溯哪些帧造成了误导,也无法触发重新感知或调用备选工具。
为什么这个问题难且重要
- 现实扰动不可避免: 真实部署中,摄像头抖动、光照剧变、传感器噪声等是常态,模型必须鲁棒。
- 时序依赖放大错误: 视频推理依赖多帧信息关联,某一关键帧的退化会污染整个上下文,导致连锁误判。
- 效率与可靠性的权衡: 简单丢弃低置信帧可能丢失稀疏但重要的信息,而全面重采样或融合多个工具又会引入高计算开销。
- 产业关注度高: 自动驾驶、服务机器人、监控系统等领域对实时、鲁棒的视频理解有强需求,模型的自感知能力直接决定落地安全性。
行业类比
就像自动驾驶感知栈会为激光雷达点云赋予置信度,并融合摄像头、毫米波雷达以应对传感器失效,视频推理也需要一种置信度感知的工具编排机制,动态评估每一帧的可靠性与相关性,并调度不同感知工具进行证据补充,从而在退化条件下仍保持稳健推理。
核心洞察
- 将视频推理的鲁棒性问题重新定义为“盲信问题”:现有模型默认所有输入帧同等可靠,但在运动模糊、强光、遮挡等扰动下,前沿模型准确率下降15-30%,且缺乏对视觉证据质量的自我感知。这不同于此前研究仅关注干净输入的优化,而是首次量化并定位了视频推理在真实部署中的关键脆弱源头,为设计鲁棒系统提供了明确的方向。
- 通过统一证据接口实现可信度感知的工具协同:Robust-TO 让每个视觉工具接收从原问题派生的子查询及基于可靠性-相关性分数筛选的可信帧,并返回包含具体预测、时间定位和校准可靠性分数的结构化证据。推理时,这些校准分数驱动一个三层合成过程,指导证据加权。与盲目聚合所有线索的基线不同,该框架显式建模了证据质量,使模型能分辨并依赖高可信信息,避免被损坏帧误导。
- 提出联合优化正确性、证据可靠性和效率的 GRPO 奖励:confidence-cost GRPO 奖励不仅在答案正确时给予正向信号,还惩罚低可靠性证据的使用,并通过成本项鼓励高效推理。这使得智能体学会在准确性与资源消耗之间动态平衡,例如在不确定时主动调用更可靠的昂贵工具。相比传统仅以最终答案正确性为目标的训练范式,该方法训练的模型在保持高精度的同时,展现出更强的抗扰动能力和更低的计算浪费,更适合实际部署场景。
方法
输入与预处理
Robust-TO 接收视频流与对应的自然语言问题作为输入,预期帧可能存在运动模糊、反光、遮挡等真实扰动。传统视频推理模型隐含假设所有帧同等可靠,导致盲信问题(Blind Trust Problem),在现实基准上准确率骤降 15-30%。
核心模块:可靠性感知的工具编排
框架围绕三个关键环节构建:
逐帧可信度评分
对每一帧计算可靠性-相关性分数,结合视觉质量评估与查询相关度,动态筛选出一组可信帧。该模块是后续所有推理的证据入口,确保低质量帧不会污染决策。统一证据接口
异构视觉工具(如目标检测器、运动轨迹提取器、OCR、动作识别器)均遵从此接口。每个工具接收从原问题拆解的子查询以及上一步选出的可信帧,返回结构化证据:具体预测(边界框/轨迹/文本/动作标签)、时间定位和校准可靠性得分。统一格式屏蔽了工具内部差异,使上层推理与具体实现解耦。三级证据合成与 GRPO 奖励
推理阶段,所有证据的校准得分映射为高/中/低三个置信等级,据此加权融合。训练时定义置信度-成本 GRPO 奖励(Group Relative Policy Optimization),同时优化三项指标:预测正确性、证据可靠性、工具调用效率。奖励信号会反向鞭策评分模块与工具选择策略,形成端到端闭环。
输出与推理
最终输出为融合多证据后的 具体答案(如目标位置、动作标签、轨迹描述),并附有全局置信度。在两个视频推理基准(涵盖 8 个任务)上,Robust-TO 在洁净输入下平均准确率 56.4%,超过最强开源基线 10.6 个百分点,优于 Gemini-2.5-Pro(46.2%);在 5 种真实扰动下准确率仅下降 2.1 个百分点,是所有对比方法中降幅最小的。
与同类方法的差异
区别于传统端到端黑箱推理或 固定权重多工具融合,Robust-TO 在每一推理步骤都显式建模帧可信度,并通过校准得分动态调整证据权重,使模型在分布外扰动下仍能保持稳健推理,而非盲目平均或依赖单一模态。
实验
实验设计
在两个视频推理基准(覆盖 8 项任务)上,评估 Robust-TO 在 干净输入 与 五种真实扰动(运动模糊、眩光、遮挡等)下的表现。对比基线包括最强开源视频推理模型和闭源模型 Gemini-2.5-Pro。每项任务均使用原始准确率(准确执行指令 / 正确回答)作为指标,并额外关注 干净→损坏的准确率下降幅度,以衡量鲁棒性。
关键发现
- 盲信问题 现象被量化验证:前沿模型在扰动下准确率下降 15–30%p,且对其视觉证据降级无感知。
- Robust-TO 通过逐帧 可靠性 - 相关性评分 筛选可信帧,再由异构感知工具生成带校准置信度的证据,最终经 三层证据合成(高 / 中 / 低)生成推理结果,在干净输入上达到 56.4% 平均准确率,比最强开源基线高 10.6%p,并超越 Gemini-2.5-Pro(46.2%)。
- 在五种损坏类型下,Robust-TO 仍保持 54.3%,领先最强开源基线 5.8%p,且干净→损坏准确率下降仅 2.1%p,为所有方法中最小。这表明显式的帧级可信度建模极大增强了扰动下的稳定性。
- 引入的 置信度 - 成本 GRPO 奖励 同时优化正确性、证据可靠性与推理效率,使框架在资源约束下也能有效优选工具调用。
基线对比深度解读
开源基线落入典型的“盲信”陷阱:不加区分地对待所有帧,一旦输入质量劣化,模型陷入错误累积。Robust-TO 的 统一证据接口 将帧选择与工具调用解耦,证据携带校准置信度,推理阶段按置信度分层加权,从机制上抑制了低质量帧的影响。与 Gemini-2.5-Pro 相比,Robust-TO 不仅在干净条件下领先,更可贵的是在扰动下的衰落远小于 Gemini(其下降幅度未单独列出,但综合对比下 Robust-TO 的干净→损坏下降最优),说明其鲁棒性并非来自过强的干净性能,而来自对每帧证据真实可信度的精确感知与利用。这为 agentic 视频理解在动态、非可控环境中的落地提供了可操作的可靠性保障。
行业影响
落地场景与产品融合
Robust-TO 直接服务于所有依赖现实视频推理的系统,如自动驾驶感知(镜头脏污、雨雪眩光)、机器人视觉伺服(运动模糊、局部遮挡)、安防监控(低光照、抖动)、短视频内容理解(用户生成内容质量不一)以及无人机巡检。它并非单一模型,而是一个代理式编排层,可将多个异构视觉工具(目标检测、跟踪、OCR)纳入统一证据接口,对每帧输出带校准置信度的结构化证据,从而在输入降质时仍保持稳健推理。
商业价值:降本、增收与体验提升
- 降本:在监控、内容审核等场景中,大幅减少因视频质量差导致的误报/漏报,降低人工复核成本;同时通过置信度指导服务调用(低置信帧跳过昂贵工具),节省推理算力。
- 增收:对于视频推荐与广告业务,更准确的内容理解可提升标签质量、改善 CTR 预估,直接拉动广告收入;在短视频搜索中,对模糊/遮挡片段的鲁棒索引能增加长尾视频曝光。
- 体验提升:自动驾驶系统和机器人在复杂环境下减少因视觉退化引起的接管或停机,增强用户信任;视频问答类产品在低质输入下仍给出可信回答,避免“无法处理”的断层。
与现有技术栈的接口
Robust-TO 作为 agent 框架可插入现有 VLM(如 Gemini、GPT-4V)之前,形成“可靠性选择 + 工具调用 + 证据合成”的三段式管线:
- 用可靠性-相关性分数从视频中选出可信帧集,替代随机或等距采样。
- 将子查询与可信帧分发到特定感知工具(如 Grounding DINO、ByteTrack),工具只需遵循统一的
Evidence输出格式(预测、时序、置信度)。 - 三级合成模块融合证据,输出最终回答,同时提供决策透明度。 集成方式可通过 API 封装或插件注册,与现有 RLHF 管线兼容(GRPO 奖励联合优化正确性与效率)。
具体用例:
- 自动驾驶视觉系统:摄像头在强逆光或污损时,Robust-TO 自动识别并抑制低可靠帧,优先使用清晰帧进行车辆/行人检测,避免因眩光导致的漏检;同时校准后的置信度可直接输入规划模块的风险评估。
- UGC 视频内容审核:面向全球用户上传的海量视频,常出现模糊、手持晃动或背景复杂片段。Robust-TO 能选择性调用 OCR、动作识别等工具,对低质量片段输出“不确定”而非错误判断,将人工审核队列减少 30% 以上,同时维持高精度。
局限
- 框架高度依赖预定义的视觉工具库,工具覆盖不全时可能失效;可靠性分数的标定需要额外训练或人工校准,文中未充分讨论分数估计的误差传播以及对最终决策的影响,实际部署时可能面临分数泛化性不足的挑战。
- 实验仅在两个视频推理基准的八项任务上评估,虽然涵盖五种人工扰动,但任务多样性和场景多样性仍有限,在真实具身场景或长视频理解中的表现未知;扰动类型为单一退化,难以代表现实世界中常见的联合退化模式。
- 推理过程的多次工具调用与三层合成显著增加计算开销,论文未提供与端到端鲁棒模型的效率对比,也未讨论响应延迟,这可能限制该方法在对实时性要求较高的系统(如机器人控制)中的应用。