VideoGen-Agent:8B 多模态智能体为视频生成调用检索与模拟工具
把视频生成拆成「先查资料、再生成、后验证」的多轮工具调用,并用强化学习训练这套决策,是提升细粒度动作与角色还原度的一条可量化路径。
视频生成模型能画出流畅动作,却未必知道太极「白鹤亮翅」的手怎么抬、重心怎么移,也未必认得出指定角色。VideoGen-Agent 用 Qwen3-VL-8B-Instruct 做底座,让智能体在多轮交互中自主调用检索、生成与验证工具:先查招式资料、再找视觉参考,必要时跑一次物理模拟,然后把结果交给视频生成器。经监督微调加多任务强化学习训练后,在 600 条提示词的 VABench 上从 56.5 分提升到 75.6 分,换更强的生成工具可达 86.1 分。
正文摘录
.jpg)  从检索动作知识、寻找角色参考,到模拟运动和衔接镜头,一个经过强化学习的智能体,能给视频生成带来多大提升? 让视频模型生成一个人打太极,画面可能很流畅。但如果把要求具体到某个招式,手该怎么抬、重心该怎么移,模型还能做对吗? 再加一点难度:指定一个角色,让它完成这套动作;或者要求两个物体按给定条件碰撞,再把一段故事分成三个连续镜头。 这些要求把视频生成带到了更细的层面。动作需要知识,角色需要视觉参照,运动需要物理约束,多个镜头还要保持顺序与连续性。仅靠一句提示词,生成模型未必能把所有细节都处理好。 如果系统可以先查资料、找参考,必要时跑一次模拟,再决定怎样生成视频,会发生什么? VideoGen-Agent 尝试把这些步骤交给一个可训练的多模态智能体 。它以 Qwen3-VL-8B-Instruct 为基础,在多轮交互中调用检索、生成和验证工具,并根据工具返回的结果继续作出决策。研究团队先用监督微调建立工具使用能力,再通过多任务强化学习改进这套决策过程。