论文

AVA-Encoder: 迈向智能体原生的视频表示学习

AVA-Encoder: 迈向智能体原生的视频表示学习

创意智能体 仍缺乏从高质量人类电影中学习的有效途径,限制了其生成电影级视频的能力。核心挑战在于缺少一种既忠实于影片内容、又能直接被智能体推理和操作的结构化视频表示。为此,我们提出 AVA-Encoder (Agentic Video Auto-Encoder),一种通过智能体自编码学习智能体原生视频表示的框架。 AVA-Encoder 将视频转换为 知识图谱 (KG) 表示,再将其重建为视频。其层级结构和状态节点存储结构化文本,链接的资源层存放生成的图像、音频和视频。类型化边以智能体易于理解、查询和编辑的形式保留这些文本描述与资源之间的关系。视频重建差异驱动一个 文本梯度优化框架,将评估反馈以自然语言更新方向表达,在外循环进行 数据无关编码策略伪训练,并在测试时内循环进行可选的数据依赖 KG 表示精炼。 大量实验表明,AVA-Encoder 相比最强外部基线提升了 20.7 个百分点。在受控的仅策略设置下,其伪训练出的镜头级 Agentic Video Encoder 策略优于人工精细调优的策略,同时使用的系统提示令牌减少了 74.3%。我们发布了完整的 AVA-Encoder 框架、可靠的智能体视频重建基准,以及首个高质量电影 KG 表示数据集。

论文精读

TL;DR AVA-Encoder 用知识图谱自编码器把视频编码成 agent 可查询、可编辑的结构化表示,并以重构误差驱动文本梯度优化,重建保真度比最强外部基线高 20.7 个百分点,提示 token 减少 74.3%。

问题

问题背景

创意智能体(creative agents)在生成电影级视频时,需要从高质量人类影片中学习可复用的结构与语义。现有视频生成模型常直接输出像素或隐式特征,智能体难以介入控制与编辑。

现有方法局限

主流视频表示主要分为三类:

  • 像素级或 latent 特征:如 VAE latent、CLIP 嵌入,虽利于重建,但不具备可查询的实体、关系与时序逻辑,智能体无法进行“替换角色服装”或“调整镜头运动”这类语义级操作。
  • 纯文本描述(如 caption、script)虽然可编辑,但丢失空间布局、视觉细节和镜头级时序,重构视频时会导致内容漂移或风格不稳定。
  • 手工构造的场景图或 storyboard 依赖大量人工,且表示格式各异,难以自动从影片中学习,泛化性差。

这些方法缺乏一种同时满足高保真重建与agent-native 可操作性的中间表示。

为什么这个问题难/重要

技术挑战在于:表示需要足够结构化以便智能体推理和编辑,同时必须保留足够视觉信息以重建高质量视频,这本质上是一个信息瓶颈与语义对齐的平衡问题。此外,如何定义“agent-native”的优化目标并不直观,需要新的训练信号。业界关注点在于:视频生成智能体在长视频、多角色、多镜头场景中常受限于上下文长度和不可控的隐式生成,一个可查询、可编辑的 KG 表示能显著降低 token 消耗(论文显示减少 74.3% 系统提示 token),并支持下游任务复用,对自动化影视制作、虚拟制片等场景有直接价值。

行业类比

类似编译器使用中间表示(IR)解耦前端解析与后端代码生成,AVA-Encoder 试图为视频生成智能体提供一种标准的“视频 IR”,让上游理解与下游渲染可以独立优化并复用。

核心洞察

  • 将视频编码为可编辑的知识图谱而非固定向量或 token 序列,使视频表示直接对齐 agent 的符号操作接口。与 latent diffusion、tokenized video 等传统表示不同,AVA-Encoder 的 KG 节点存储结构化文本与资产层,typed edges 保留关系,agent 可查询、编辑并传播修改。这解决了 creative agents 缺乏可操作视频表示的问题,同时使 system-prompt token 用量减少 74.3%,为视频生成 pipeline 提供了低开销、可解释的中间表示。
  • 用重构误差驱动的 textual gradient 双环优化替代端到端训练,无需外部标注即可自动进化编码策略与 KG 表示。外环 Data-Independent Encoding Policy Pseudo-Training 将评估反馈转化为自然语言更新方向,学习通用策略;内环 Data-Dependent KG Representation Refinement 在测试时细化具体视频。对比固定 prompt 与人工调参,该方法在 policy-only 设置下超越人类调优策略,并相对最强外部 baseline 提升 20.7 个百分点,展示了自改进闭环在视频表示系统中的工程可行性。

方法

输入与编码

输入视频首先经过 Agentic Video Encoder,将视觉内容解析为 知识图谱 表示。图谱包含层级节点与状态节点,分别存储结构化文本描述;同时链接一层资产层,保存生成的图像、音频、视频片段。类型化边连接文本节点与资产节点,形成 agent 可直接查询、编辑和推理的关系结构。

双环文本梯度优化

重建过程将知识图谱还原为视频,重建差异被转化为自然语言形式的更新方向,驱动双环优化:

  • 外环:执行 Data-Independent Encoding Policy Pseudo-Training,在伪训练集上学习通用编码策略,不依赖具体数据。
  • 内环:测试时执行 Data-Dependent KG Representation Refinement,针对特定输入进一步细化图谱表示。

两级优化分别通过接受门控控制更新进入图谱。

输出与差异

最终输出为优化后的知识图谱,既支持高保真视频重建,也直接作为下游创意 agent 的可操作中间表示。与传统视频自编码器的隐空间表示不同,该表示可解释、可编辑,并显著降低 agent 交互所需的系统提示 token 数量(减少 74.3%)。

实验

实验设计

AVA-Encoder 在代理式自动编码 框架下评估,包含四个研究问题(RQ1–RQ4):重建保真度、两阶段优化贡献、知识图谱可操作性、下游重用。基线包括外部方法(VideoAnalyzer、Storyboard Studio、soap2soap)和人类调优策略。评估使用重建差异度量和盲回标评分。

关键发现

  • 相比最强外部基线,重建保真度 提升 +20.7 个百分点。
  • Data-Independent Encoding Policy Pseudo-Training 产出的 shot 级策略比人类调优策略减少 74.3% 系统提示 token,且性能更优。
  • 消融表明两阶段优化(外环伪训练 + 内环 KG 细化)均有效,接受门控机制提升稳定性。

基线对比解读

AVA-Encoder 的优势源于知识图谱结构化表示 与文本梯度优化 的结合:外部基线缺乏可查询、可编辑的中间表示;人类调优策略依赖大量手工提示词,token 开销大。该方法在不增加生成器负担的前提下,通过策略学习压缩提示空间,同时保持或超越人类调优效果,对实际工程中构建可维护的视频生成智能体 具有参考价值。

行业影响

落地场景

AVA-Encoder 面向 agentic video creation 工具链,适合三类业务:

  • AI 视频生成平台:用户输入剧本/分镜,由 agent 生成并迭代视频;知识图谱 (KG) 表征可被查询、编辑,支撑多轮创意修改。
  • 电商商品视频:根据商品信息自动生成多镜头展示视频,agent 可修改镜头顺序、风格、旁白。
  • 影视 / 广告预演:低成本生成 previs,创意团队可以基于 KG 节点精准调整叙事和视觉元素。

商业价值

  • 降本:伪训练后的 shot-level encoder 比人工调优策略减少 74.3% system-prompt tokens,直接降低 LLM API 成本。
  • 增效:重建保真度较最强外部 baseline 提升 20.7 个百分点,提高生成内容的可用率,减少人工返工。
  • 体验升级:KG 的可编辑、可解释特性让非技术创意人员也能参与修改,缩短生产周期。

与现有工作流集成

可作为视频生成 pipeline 的中间表征层:输入原始视频或脚本,输出 KG 表示,下游 agent 据此调用生成器。与 video diffusion model 解耦,资产层管理图像/音频/视频,便于替换底层模型。提供 Python SDK 或 API 后,可集成进 LangChain 等 agent 框架,与现有 LLM 协同工作。

具体用例

  • 内容平台智能剪辑:对海量影视素材预编码为 KG,agent 根据用户 query 检索并重组镜头,生成解说或混剪视频。
  • 企业培训视频:输入产品手册和操作录像,生成结构化视频教程,agent 根据反馈自动调整步骤或补充标注。

局限

  • **重建保真度受限**:AVA-Encoder 采用知识图谱(KG)作为视频的中间表示,这虽然便于智能体理解与编辑,但 KG 的抽象层级可能丢失低层次视觉细节(如光线变化、微表情、镜头运动质感),导致重建视频与原始电影在视觉质量上仍有明显差距。论文中的重建 benchmark 显示指标提升,但未达到像素级保真,且重建质量受限于底层图像/视频生成模型的能力。与直接端到端生成模型相比,该方法牺牲了一定的视觉表现力以换取可操作性,在追求电影级视觉质量的应用中可能不够充分。
  • **优化流程复杂且成本高**:双循环文本梯度优化需要频繁调用大语言模型(LLM)生成更新方向,外循环数据无关策略伪训练依赖大规模视频集合,内循环测试时细化进一步增加推理延迟。尽管论文声称系统提示 token 减少 74.3%,但整体训练与推理阶段的 LLM 调用开销可能远高于传统视频编码器,限制实时交互或大规模部署。此外,文本梯度信号的稳定性依赖精心设计的提示模板与接受门控,若反馈模糊或冲突,优化方向可能发散,需要额外人工干预。
  • **泛化性与数据集局限**:论文发布的电影 KG 数据集为高质量电影片段,但覆盖的题材、风格有限;伪训练与评估视频集合也偏向特定叙事结构。知识图谱 schema 专为电影镜头设计,扩展到体育、监控、教育等非叙事视频时需要重构节点类型与边关系。与现有视频表示学习方法(如 VideoMAE、VideoCLIP)的对比不足,仅在少数智能体基线(VideoAnalyzer、Storyboard Studio)上验证,无法充分说明该方法在通用视频理解任务上的竞争力。
论文Chuyue Li2026-08-12原文

相关内容