论文

VideoGen-Agent:强化视频生成智能体

VideoGen-Agent:强化视频生成智能体

近年来,视频生成模型已能产出高保真、时序连贯的视频,但在需要专门知识、特定身份、物理一致性或有序事件的提示上仍表现不佳。为此,作者提出 VideoGen-Agent,一个通过多任务智能体强化学习训练、能调用外部工具完成视频生成的多模态智能体。 方法上,智能体通过多轮交互协调增强、生成与验证三类工具,依据提示和中间观测做决策;在覆盖六类任务的类别均衡数据集上训练共享策略。先用教师生成的轨迹做监督微调建立工具使用行为,再通过强化学习精炼;同时设计类别感知混合奖励,评估工具调用有效性、工具选择是否契合任务以及生成视频质量。 作者进一步提出 VABench,一个包含 600 条提示的留出基准,覆盖程序性知识、单/多实体身份保持、物理一致性、场景构图与多镜头时序结构。在 VABench 上,VideoGen-Agent 比自己基础的 text-to-video 生成器提升 19.1 分(56.5 → 75.6);仅升级生成工具即可进一步升至 86.1,无需额外训练智能体。人类评审在 84.3% 的对比中更偏好升级后的配置,而非最强独立基线,表明跨视频生成任务学习工具使用有效,且训练的智能体能受益于生成工具的后续进步。

论文精读

TL;DR VideoGen-Agent 用多任务 agentic RL 训练智能体调用增强、生成、验证工具,在 VABench 上把得分从 56.5 提升到 75.6,且换成更强生成工具后无需重训即可涨到 86.1。

问题

问题背景

当前视频生成模型的视觉质量已接近实拍,但仅靠文本条件的前向扩散采样难以满足需要外部知识、身份一致性、物理约束与事件顺序的复杂提示。

现有方法局限

  • 知识固化:模型依赖预训练时固定参数,无法表现训练后出现的新实体或新事件。
  • 身份漂移:对具名人物或特定角色的视觉特征保持不稳定,长视频中易发生外观变化。
  • 物理失实:运动轨迹常违反重力、碰撞等基本规律,生成结果不符合物理直觉。
  • 顺序缺失:对指定动作序列的提示,模型可能重复、遗漏或打乱顺序,影响叙事逻辑。

这些限制的根源在于单一生成器缺乏对提示的规划、外部信息检索和结果验证能力。

为什么难/重要

视频生成须同时满足语义、时序、物理与身份约束,属于高维复杂决策问题。可控视频在产品演示、教育培训、体育分析、电影预可视 等场景有明确需求,但当前模型的事实准确性与一致性仍达不到实用阈值。业界因此关注从“单一生成器采样”向“多工具代理”的范式转换,其中多任务工具调用策略与可扩展的奖励设计是核心挑战。

行业类比

类似大语言模型在知识截止或需要实时信息时,从纯生成转向检索增强生成 与工具调用,视频生成也需要从单模型前向扩散走向工具编排的代理范式。

核心洞察

  • VideoGen-Agent 证明视频生成的瓶颈不只在于生成模型本身,而在于 agent 对工具的选择与协同。通过 RL 训练一个共享策略,在多轮交互中决定何时调用检索、物理模拟、验证等工具,将知识、身份、物理约束等外部信息注入生成流程。这与直接微调 diffusion 模型或硬编码 pipeline 不同,策略可泛化到未见任务组合,且生成工具升级后无需重新训练即可受益,展现了 tool-use agent 的模块化优势。
  • 该工作的 category-aware hybrid reward 和 task-level advantage normalization 是多任务 agentic RL 的关键贡献。将格式、工具有效性、视频质量按任务类别加权,并在 token 级 GRPO 中按任务难度归一化优势,避免了简单平均奖励导致的梯度冲突和任务偏斜。这为其他需要同时优化多种工具调用和最终生成质量的任务提供了可复用的训练配方。
  • 采用 SFT 先模仿教师轨迹再 RL 优化的两阶段范式,有效解决了视频生成 agent 冷启动的探索难题。教师轨迹提供了合理的工具调用序列,SFT 建立基本行为,而后 RL 利用混合奖励细化策略。相比从零 RL,此方法收敛更快且更稳定,并验证了在六类任务上共享策略的可行性,为复杂多模态 agent 的训练流程提供了实践参考。

方法

输入:用户自然语言 prompt,可能包含程序性知识、身份保持、物理一致性、有序事件等单一或组合需求。

关键模块 包括:

  1. 多任务 Agent 工作流:agent 在六类任务上共享一个策略,可调用三类工具——augmentation(如知识检索、身份图像增强)、generation(基础文生视频模型,可替换)和 verification(视觉检查、物理规则检查等)。agent 接收 prompt 与中间观察,进行多轮工具调用决策,生成结构化轨迹。
  2. 数据构建:对六类任务构造类别平衡的提示,用 teacher 策略生成参考轨迹,保证工具调用逻辑与任务类型对齐。
  3. 两阶段训练:
    • SFT 在 teacher 轨迹上训练,建立初始工具使用行为。
    • Agentic RL 采用类别感知混合奖励:包括工具调用格式/可用性、任务适配的工具选择、生成视频质量(由 VLM 评估)。引入 task-level advantage normalization 和 token-level GRPO 目标,使策略在工具调用 token 上获得逐 token 优势信号,稳定多任务训练。
  4. 验证与反馈闭环:verification 工具产生的观察作为上下文反馈给 agent,使其可修正后续工具选择或停止生成。

输出:agent 输出一系列工具调用(可能是增强→生成→验证→再生成的循环),最终由 generation 工具产出视频。

差异点:区别于固定 pipeline 或仅对生成模型微调,VideoGen-Agent 将工具选择建模为可学习的策略,并通过多任务 RL 优化长程工具组合,因而在更换更强 generation 工具时无需重新训练 agent,即可直接提升整体表现。

实验

实验设计

构建 类别均衡训练集,覆盖六类任务:程序性知识、单/多实体身份保持、物理一致性、场景构成、多镜头时序结构。训练分两阶段:先用教师轨迹做 监督微调 (SFT) 建立工具调用行为,再用 多任务智能体强化学习 (RL) 优化策略;奖励为 类别感知混合奖励,包括工具调用合法性、任务适配工具使用和生成视频质量。评测使用留出基准 VABench,共 600 条 prompt。

关键发现

  • VideoGen-Agent 在 VABench 上将 base T2V 的 56.5 提升到 75.6,提升 +19.1 点。
  • 升级生成工具后分数进一步到 86.1,且无需额外 agent 训练。
  • 人类评估中,升级配置在 84.3% 的对比中优于最强 standalone baseline,说明多轮工具协调和验证闭环带来超越单一模型的质量增益。

与基线对比解读

相比直接使用 base T2V,提升来自 多轮工具调用、验证反馈闭环 和 任务适配的工具选择,而非模型参数缩放。与最强 standalone baseline(升级生成工具)相比,agent 仍保持优势,因为其策略可迁移至更强工具,无需重新训练;这验证了工具使用策略的可扩展性。但 VABench 只覆盖六类任务,仍需更广泛评测以确认泛化边界。

行业影响

落地场景:VideoGen-Agent 可嵌入视频生成平台,服务于电商产品视频自动化(如多镜头展示同一商品并保持外观一致)、教育视频(科学实验物理过程演示)、企业宣传片(品牌元素一致性)和影视预可视化(有序动作序列)。自动驾驶仿真需要物理一致的多视角场景视频,可作为合成数据生成前端。

商业价值:直接降低人工审核与重生成成本。模型在 VABench 上从 56.5 提升到 75.6,升级生成工具后达 86.1,显著减少不合规视频返工。同时支持未见任务组合,减少定制开发。复杂 prompt 可用性提升带来更高采用率。

接口:作为轻量级 agent 层,插入现有文生视频 API 之前。通过工具调用协议协调 augmentation / generation / verification,已有视频生成模型可作为 generation 工具替换。训练好的 policy 无需重训即可受益于更新 generator,支持渐进式升级。企业可部署为微服务,接收 prompt 并输出最终视频及中间验证日志,便于审计。

具体 use case:电商场景中,给定“展示一款蓝牙耳机从充电盒取出、佩戴、连接手机的三镜头视频”,传统模型可能丢失耳机身份或镜头顺序;VideoGen-Agent 调用检索工具获取产品参考图、生成后由验证工具检查镜头顺序,输出符合商详要求的多镜头视频。教育平台制作自由落体与碰撞演示时,agent 调用物理仿真器生成参考轨迹,确保物理一致性。

局限

  • - 工具集依赖与扩展性受限:虽然论文展示了升级生成工具能进一步提升性能,但 agent 的策略训练基于固定的工具集和接口。若工具类型发生变化(如更换物理模拟器或引入新的验证 API),可能需要重新收集轨迹或微调策略,迁移成本较高。此外,多轮工具调用增加了推理延迟,实际部署时实时性存疑。论文未讨论对未见工具种类的零样本适应能力。
  • - 奖励设计复杂且依赖 VLM 判断:混合奖励由格式奖励、工具使用奖励和类别特定 VLM 奖励组成,其中 VLM 对视频质量的评价可能存在偏差,尤其对于物理一致性和时序结构的判断能力有限。不同任务类别的权重需要人工调参,且容易引发奖励 hacking(如生成讨好 VLM 但不符语义的视频)。论文未系统分析奖励组件的鲁棒性和敏感性。
  • - 基准规模与对比实验有限:VABench 包含 600 个 prompt,虽然覆盖六类任务,但每类平均仅 100 个样本,统计显著性有限。评估主要对比基座视频生成模型,缺乏与现有其他视频生成 agent 或相关工具增强方法的直接比较。未在更大规模、更开放的 prompt 分布上验证,泛化性证据不足。
论文Binxu Li2026-09-21原文

相关内容