ParaVT: 驯服工具先验悖论——面向智能体视频强化学习中并行工具使用
训练大型多模态模型(LMMs)通过强化学习(RL)原生调用视频处理工具(如裁剪)已成为长视频理解的有前景路径。然而,现有原生RL方法按顺序调度工具调用(每轮一个):单次错误裁剪会传播误差而无同行校正,多轮工具调用污染上下文,且推理成本随调用轮数线性增长。 我们提出 ParaVT,首个 多智能体端到端 RL 训练框架 用于 并行视频工具调用,在单轮中调度多个时间窗口裁剪,以获得更干净的上下文和更好的容错性。将标准RL应用于 ParaVT 却暴露出我们称之为 工具先验悖论 的障碍:预训练工具先验虽使工具探索成为可能,但同时也破坏了冷启动的结构化格式,并在温度采样下暴露出跳过工具的奖励捷径。跨模型对比(使用较弱先验的 LMM)支持这一观点:格式保持稳定但 RL 诱发零次工具调用,表明先验强度既是格式崩溃的共同驱动因素,也是工具探索的驱动因素。 我们提出 PARA-GRPO(Parseability-Anchored and Ratio-gAted GRPO),通过两种互补机制增强标准RL:(i) 仅在结构标记位置(最易崩溃处)应用目标格式奖励;(ii) 每提示帧预算随机化,创建训练提示使调用工具相比于跳过工具产生可衡量的奖励信号。在六个长视频理解基准上,ParaVT 平均比 Qwen3-VL 基线提升 +7.9%,而 PARA-GRPO 将训练时格式合规率从 0.13 提升至 0.64。 随着现代 LMMs 的工具能力日益内化,RL 必须与由此产生的先验协作,ParaVT 为智能体 RL 提供了一种通用方案。代码、数据和模型权重已公开。
论文精读
TL;DR ParaVT 首次实现并行视频工具调用的多智能体 RL 训练,揭示并解决工具先验悖论,通过 PARA-GRPO 稳定格式并提升探索,长视频理解平均提升 7.9%。
问题
问题背景
长视频理解是当前视觉语言模型(LMM)的核心挑战,通过强化学习(RL) 训练模型原生调用视频处理工具(如裁剪、关键帧提取)已成为一条有前景的技术路线。这类方法试图让模型学会在推理时自主决定何时调用何种工具,以突破固定帧采样的信息瓶颈。
现有方法局限
现有原生 RL 方法依赖顺序工具调用(每轮只调用一个工具),存在三个关键局限:
- 错误传播与缺乏纠错:单一错误裁剪会持续污染后续推理,无并行分支进行交叉验证或修正。
- 上下文污染:多轮工具调用产生的中间结果反复拼接,导致上下文窗口膨胀、信息冗余。
- 线性增长的推理成本:推理耗时和 token 消耗随工具调用轮数线性增加,难以满足实时或大规模应用需求。 这些局限根源在于单线程的调用范式,无法利用多工具并行带来的容错性和信息增益。
为什么这个问题难且重要
将工具调用从顺序改为并行看似直接,但标准 RL 训练会触发 Tool Prior Paradox:预训练赋予模型的工具使用先验(prior)既是 RL 中探索工具调用的驱动力,又会在冷启动时导致格式崩溃(不再遵循工具调用语法),并在温度采样下暴露“跳过工具”的奖励捷径——模型发现不调用工具也能获得不错奖励,从而丧失工具使用能力。这揭示了 RL 与 LMM 内部先验冲突的深层矛盾:先验强度同时决定格式稳定性和工具探索,如何平衡二者是并行工具 RL 的核心技术挑战。随着现代 LMM 越来越内化工具能力,该问题直接影响 Agent 系统的可靠性,业界亟需通用解决方案。
行业类比
类似多模态对话 Agent 需要并行调用多个 API 而不中断对话流,ParaVT 的并行多代理 RL 为视频分析、自动化 Agent 等工作流提供了高容错、低延迟的设计范式,尤其适用于需要实时处理多段视频流的监控、内容审核等场景。
核心洞察
- 并行工具调用通过多智能体单轮分发,从根本上解决了顺序调用中错误累积、上下文污染与推理成本线性增长的问题。与逐轮调用不同,ParaVT 让多个 crop 代理同时提交候选窗口,不仅能相互纠错提升容错,还避免了多轮对话导致的上下文片段化,推理成本与工具数量解耦,在长视频理解任务上带来更干净的特征融合和更稳定的训练信号。
- 作者发现的「工具先验悖论」揭示了 LMM 在 RL 训练中一个深层矛盾:预训练赋予的工具调用倾向既是探索的驱动力,又是格式崩溃的根源。PARA-GRPO 通过选择性结构令牌奖励和帧预算随机化门控,巧妙地平衡了先验带来的稳定与探索,为后续将工具能力内化的 agentic RL 提供了一种可复用的训练范式,避免了传统 GRPO 因温度采样导致的格式退化与跳过工具的奖励捷径。
方法
方法概览
ParaVT 方法围绕长视频理解 中的并行工具调用 与强化学习训练 展开,其输入为一段长视频及一条自然语言查询。
1. 框架设计:并行视频工具调用
现有原生 RL 方法通常以回合制 顺序调用视频处理工具(如裁剪),导致错误累积、上下文污染与推理成本线性增长。ParaVT 开创性地引入多智能体并行工具调用 框架:单次生成中同时分派多个时间窗口裁剪,获取多视角并行处理,单回合交互即可获得更干净的上下文与更强的容错能力。训练分两阶段:先用冷启动 SFT 构建并行工具轨迹样本,再以可验证奖励 进行 RL 微调,实现端到端优化。
2. 训练创新:PARA-GRPO 驯服工具先验悖论
直接将标准 RL 应用于 ParaVT 会遭遇工具先验悖论:预训练模型内置的强工具使用先验既能驱动探索,也会在冷启动时引发格式崩溃(如 XML 结构 token 错乱)与奖励捷径(模型学会跳过工具调用即可获得预期回报)。PARA-GRPO 提出两种互补机制:
- 选择性格式锚定 (Selective Anchoring):仅在最容易坍塌的结构 token 位置施加额外格式奖励,既保持工具调用的自由度,又稳定输出格式。
- nFrames 门控 (nFrames Gating):对每个训练提示随机设定帧预算,制造出调用工具比跳过工具能产生可衡量奖励信号的场景,迫使模型正视工具使用价值。
最终模型输出包含多个并行工具调用的结构化响应,并给出推理答案。与传统顺序方法相比,ParaVT 以单回合并行调用大幅降低推理成本与错误传播,并首次针对 RL 场景下的工具先验悖论提出系统性解法,为内嵌工具能力的大模型强化学习提供通用范式。代码与模型权重已公开于 GitHub 和 项目主页。
实验
实验设计
实验围绕 ParaVT 框架展开,该框架支持在单个推理回合中并行调用多个视频裁剪工具。训练分为两阶段:
- 冷启动 SFT:使用 97K 样本,其中部分包含工具调用轨迹,通过 Gemini 模型蒸馏并行调用序列,初步建立模型对并行工具格式的感知。
- Agentic RL:在 4,406 个视频问答样本上进行强化学习,采用可验证奖励(如答案正确性、格式合规性)优化策略。
核心 RL 算法为 PARA-GRPO,针对工具先验悖论引入两项创新:
- 解析性锚定:仅在结构 token(如
<tool_call>)位置施加格式奖励,稳定输出结构。 - 帧数门控:随机化每样本可调用帧数,迫使模型在适当场景下主动调用工具,避免跳过工具的奖励捷径。
消融实验考察了 SFT 数据比例、锚定范围、门控策略对格式遵从度和最终任务性能的影响。
关键发现
- 并行调用显著优于串行:一次输出多个裁剪结果,减少了错误传播和上下文污染,且推理开销不再随工具调用次数线性增长。
- 工具先验强度是双刃剑:跨模型对比显示,较弱先验的 LMM 虽格式稳定,但 RL 无法诱导其调用工具;强先验模型有助于探索,却易引发格式崩溃。PARA-GRPO 通过锚定和门控在两者间取得平衡,将训练时格式遵从度从 0.13 提升至 0.64。
- 帧数门控是避免“跳过工具”捷径的关键:随机化帧预算使得跳过工具无法稳定获得高奖励,模型必须学习在信息不足时主动调用工具裁剪关键片段。
基线对比深度解读
与 Qwen3-VL 基线相比,ParaVT 在六个长视频理解基准上平均提升 7.9%,表明原生工具调用能力可被 RL 有效激发。更重要的是,PARA-GRPO 解决了标准 RL 难以在保持格式稳定的同时激发工具探索的矛盾,为后续将工具使用能力内化到多模态模型中提供了通用范式。该工作揭示了在 RL 微调大模型时,预训练先验对探索与稳定性耦合影响的普遍规律,对工程落地具有重要指导意义。
行业影响
落地场景
ParaVT 的并行视频工具调用能力可直接赋能需要高效处理长视频的 AI 产品,典型场景包括:
- 视频内容审核与安全监控:对直播、上传视频进行分段并行分析(如裁剪、OCR、场景识别),显著缩短响应延迟。
- 教育 / 企业培训视频索引:自动为长时间课程视频生成结构化时间轴标注,支持多窗口跳转定位。
- 医疗影像分析:在内窥镜录像等长程手术视频中同时检测多个关键帧,辅助医生快速回顾。
- 电商直播带货分析:并行截取多个商品曝光片段,实时提取描述、价格等信息,支撑选品决策。
商业价值
- 降本:将顺序工具调用改为单轮并行分发,推理成本随工具数量线性增长变为常数级。论文中 ParaVT 在保持性能的同时,降低了多轮 API 调用的 token 开销与延迟,对大规模视频处理管线尤为关键。
- 增收:长视频理解的准确性提升直接带来更好的用户体验与更高的转化率。例如,在内容推荐场景中,更精准的视频标签能优化广告投放,增加平台收入。
- 体验提升:通过 PARA-GRPO 强化学习训练后的格式合规与工具调用鲁棒性,避免了因单次裁剪错误导致的整段理解失败,输出更可靠,减少人工复核成本。
与现有产品 / 工作流的集成
ParaVT 以 Qwen3-VL 为基础模型,提供开源的权重与代码,支持以下集成方式:
- 基于 vLLM 的推理服务:通过标准 HTTP API 暴露并行工具调用接口,现有视频处理管线可将 ParaVT 作为下游推理节点替换原有顺序流程。
- 多智能体框架适配:能与 LangGraph 等编排工具结合,将并行视频工具调用封装为 Agent 工具,由上层协调器动态分配视频片段。
- 数据闭环:支持在线 RL 微调,企业可利用自身业务数据持续优化并行策略,适应特定领域(如工业质检视频)的长尾分布。
具体落地用例:
- 短视频平台内容审核:创作者上传的 10 分钟 vlog,系统在一轮生成中同时请求 5 个时间窗口的裁剪,并行检测暴力、违规广告、版权音乐,将审核时间从 30 秒降至 5 秒以内。
- 自动驾驶路测数据分析:路测记录仪产出数小时视频,利用 ParaVT 并行提取多个关键事件片段(急刹车、变道、行人穿行),并自动关联传感器日志,加速算法迭代。
局限
- **工具泛化性有限**:ParaVT 及其 PARA-GRPO 训练策略专门针对视频裁剪(cropping)等时间窗口工具设计,架构假设动作空间可分解为并行的窗口请求。当扩展到目标检测、检索或剪辑等工具时,并行调用的语义对齐和奖励设计可能需大幅改动,且未在其他工具类型上验证。这限制了框架作为通用并行智能体 RL 方案的直接可迁移性。
- **对冷启动 SFT 依赖较强**:并行工具调用 RL 训练严重依赖于精心构造的冷启动有监督微调(SFT)阶段,否则格式崩溃和零工具调用问题几乎不可避免。虽然 PARA-GRPO 通过格式锚定缓解了崩溃,但若初始 SFT 数据质量不足或缺少并行工具轨迹,RL 仍难以收敛,这提高了工业落地的数据准备门槛。
- **先验悖论的验证范围较窄**:工具先验悖论(Tool Prior Paradox)的实证证据仅依赖 Qwen3-VL 与一个弱先验模型的对比,未在更多 LMM(如 LLaVA、InternVL)上重复。不同预训练范式和规模下模型的先验强度差异可能影响结论的普遍性,且论文未给出量化“先验强度”的统一指标,使得悖论的边界条件尚不清晰。