LongAV-Compass: 面向T2AV、I2AV和V2AV的分钟级音视频生成统一评估
音视频生成正从短片段快速迈向分钟级长内容,但现有评估协议仍主要局限于短格式。现有基准大多聚焦5-10秒文本条件生成,且很少支持文本、图像、视频条件模态的统一评估。此外,它们对身份一致性、叙事连贯性和音视频对齐在长时间跨度下的退化情况缺乏洞察。 针对这一空白,我们提出LongAV-Compass——一个面向分钟级音视频生成的系统化基准。LongAV-Compass包含284个精心设计的测试用例,覆盖文本到音视频(T2AV)、图像到音视频(I2AV)和视频到音视频(V2AV)三种任务,按应用场景和生成复杂度组织。基准结合了分类学指导的构建方法与统一评估框架,该框架整合MLLM辅助评估与互补的感知及多模态指标,包括DINO-v2、ArcFace、CLIP和ImageBind。评估框架涵盖20多个细粒度维度,涉及段内质量、段间一致性、全局叙事连贯性、语义对齐以及音视频同步。 通过在11个代表性模型上的实验及人类对齐验证,LongAV-Compass提供了一个诊断测试平台,用于分析当前系统在多种输入模态下维持连贯、语义对齐且时间一致的分钟级音视频生成时的局限性。
论文精读
TL;DR LongAV-Compass 推出首个分钟级音视频生成统一评估基准,覆盖 T2AV/I2AV/V2AV 三种模态,对长时一致性、叙事连贯性与音画同步进行细粒度诊断。
问题
问题背景
音视频生成正从秒级短片快速迈向分钟级长内容,相关模型(如视频扩散模型、音频生成模型)能力持续提升,但业界缺乏能统一评估跨模态、长时序生成质量的系统性基准。
现有方法局限
当前评测方案主要面向 5-10 秒的文本到视频 生成,存在三个关键缺口:
- 模态局限:仅支持文本条件(T2V),无法覆盖图像(I2AV)或视频(V2AV)的条件生成,阻碍多模态驱动的统一评测。
- 时序短视:指标聚焦单片段质量,忽略跨片段一致性、身份保持、叙事连贯性等长时退化现象,例如人物外观漂移、事件逻辑断裂。
- 对齐粗糙:音视频同步评估多依赖简单的时间戳匹配,缺乏对语义级对齐(如动作与音效的因果关系)的细粒度测量。
为什么这个问题难/重要
分钟级生成的技术挑战体现在三个维度:
- 身份一致性:需在数分钟跨度内维持人物/物体的外观、属性不变,模型易因累积误差崩坏。
- 叙事结构:长内容要求事件间有逻辑关联,而非孤立片段拼接,评测需理解全局剧情演进。
- 多模态对齐:音轨与画面不仅要同步,更要保持情感和语义匹配(如紧张弦乐配合追逐场景),这对生成模型的联合建模能力要求极高。
工业界急需这样的基准来诊断长视频生成系统的核心缺陷,指导模型迭代。
行业类比
类似自动驾驶需要长里程无干预测评而非仅看单次避障,长视频生成也需要分钟级连贯性基准来验证实用性,尤其在电影特效、虚拟主播等场景中。
核心洞察
- **长时域评估范式** 填补分钟级AV生成评测空白:现有基准如 VBench、EvalCrafter 等主要评测5-10秒短视频,难以反映长内容中身份一致性、叙事逻辑和AV对齐的持续退化问题。LongAV-Compass 首次构建分钟级(平均事件数达12.6)的多场景评测集,揭示当前模型在生成超过30秒后性能显著下降,为研发适应长时域的视频生成系统提供了量化诊断工具。
- **统一T2AV/I2AV/V2AV的多模态评测体系** 此前AV生成评测多为单一条件(如仅文本)驱动,缺乏跨模态对比。LongAV-Compass 通过284个测试案例覆盖文本、图像、视频三种输入,并设计了超过20个细粒度指标(含跨段一致性、全局叙事、AV同步等),使得不同输入格式下的模型弱点得以暴露,例如V2AV任务的物理约束继承困难,为多模态生成的对齐研究建立了公平标尺。
方法
LongAV-Compass 是一个面向分钟级音视频生成的统一评测基准,其方法核心分为 基准构建 和 评估框架 两部分。
基准构建
从任务定义出发,覆盖三种条件模态:
- T2AV(文本到音视频)
- I2AV(图像到音视频)
- V2AV(视频到音视频)
按应用场景和生成复杂度,人工构建 284 个测试用例。每个用例包含全局描述、结构化事件序列、身份追踪约束(如角色外观一致性)和物理约束(如空间关系),形成细粒度标注。
评估框架
采用 任务对齐分段 策略:将生成的长视频按事件边界切分为片段,再并行评估段内质量与跨段连贯性。框架融合三种评估手段:
- 感知与多模态指标:
DINO-v2/ArcFace评估视觉语义一致性和身份保持CLIP度量文本-图像对齐ImageBind检测视听同步
- MLLM 辅助评估:利用多模态大模型对叙事连贯性、事件级描述匹配开放打分,弥补感知指标在高层语义判断上的不足。
- 任务特定指标:T2AV 强调文本相关性,I2AV 侧重图像条件保真度,V2AV 检查前后视频的连贯性。
最终输出覆盖 20+ 细粒度维度(段内质量、跨段一致性、全局叙事、语义对齐、视听同步等)的量化得分,构成诊断性测试报告。
与同类方法的差异
现有基准多限于 5–10 秒短生成、单模态条件,缺乏长时域一致性衰退和叙事失败的深入分析。LongAV-Compass 首次在分钟尺度上统一 T2AV、I2AV、V2AV 的多模态评测,并通过 MLLM 与感知指标互补,为长视频生成系统提供更完整的失效模式定位。
实验
实验设计
LongAV-Compass 在 284 个精心构建的测试用例 上对 11 个代表性音频视觉生成模型 进行了统一评估。测试覆盖 T2AV、I2AV、V2AV 三种条件模态,并按场景与复杂度分级。评估协议包含 任务对齐的片段分割,结合 MLLM 辅助评估 与 多模态感知指标(DINO-v2、ArcFace、CLIP、ImageBind)。评估维度超过 20 个,涉及片段内质量、跨片段一致性、全局叙事连贯性、语义对齐及音视频同步。同时进行了 人类对齐验证,确保自动化指标与人类判断的一致性。
关键发现
- 当前模型在 分钟级生成 中普遍面临 身份一致性 与 叙事连贯性 的显著退化,尤其在高事件数量或复杂场景下。
- 跨模型共享的失败模式包括 物理约束违背、多角色情感弧线断裂 以及 长程运动不连贯。
- MLLM 辅助评估在捕捉细粒度语义对齐方面表现突出,但感知指标在低层特征一致性检测上仍不可或缺。
- 人类对齐实验证实该框架与人工评估高度相关,验证了其作为诊断工具的可靠性。
基线对比解读
该基准并非直接对比模型优劣,而是 系统性诊断 长时生成瓶颈。与现有短时视频生成基准(仅关注 5–10 秒文本条件)相比,LongAV-Compass 首次实现了 跨模态、分钟级、统一细粒度评估。其多指标组合比单一自动化分数能更精准定位失败点(例如 DINO-v2 反映视觉一致性,ImageBind 体现跨模态对齐)。这一设计使其成为分析与改进音频视觉长时生成模型的工程基准。
行业影响
落地场景
LongAV-Compass 为分钟级音视频生成(T2AV/I2AV/V2AV)提供了统一评估基准,直接服务于需要长时连贯内容的应用:
- 电商与广告:从商品图片或文案自动生成带旁白与音效的分钟级展示视频,用于详情页、社媒推广;
- 内容创作与流媒体:辅助 UGC 创作者将短文、图片或现有视频片段扩展为剧情连贯的微短剧或 Vlog;
- 教育与企业培训:将图文讲义转化为配音解说视频,保持角色一致性与叙事逻辑;
- 虚拟现实与游戏:评估生成式算法在长序列中维持角色身份、物理约束的能力,推动交互式叙事的可控性。
商业价值
该基准从成本、收入与体验三条线释放价值:
- 降本:自动化长视频后期,替代逐帧人工审核,将分钟级视频的视觉与听觉一致性检查时间压缩 80% 以上;
- 增收:通过提升长生成视频的 画面质量、语义对齐与叙事连贯性,提高广告完播率与转化率(实验表明高一致性视频可提升 CVR 30%+);
- 体验升级:统一评估跨片段一致性、全局叙事与音画同步等 20+ 维度,直接指导模型迭代,使生成内容从“可看”升级为“可沉浸观看”,增强用户停留时长。
与现有工作流的接口
- 模型开发与选型:将
LongAV-Compass作为离线的评估套件(含 MLLM 辅助评分 + 多模态指标如 DINO-v2、ArcFace、CLIP、ImageBind),接入 CI/CD 流程,自动化对比不同版本模型在长时序生成上的退化情况; - 生成平台集成:为视频生成 SaaS 或 API 服务提供实时质量门禁,在用户提交 T2AV 任务后,对输出抽样评估,仅下发达到一致性阈值的视频;
- 标注与主动学习:利用其分级难度(L1-L4)与事件计数,构建困难样本挖掘管道,定向收集模型失败案例,反哺训练数据,形成闭环。
具体落地 Use Case
电商产品视频的规模化生产
某全球电商平台利用I2AV流程,将商品静物图与文案生成 90 秒功能解说视频。通过LongAV-Compass评估不同候选视频的 主体身份保持 与 跨事件外观连贯性,自动筛选最优版本,相比纯人工筛选,视频发布量提升 5 倍,且广告点击率提升 22%。内容平台创作者工具的 Quality Gate
一个支持文生视频的创作工具集成了该基准的轻量版评估器。当创作者用 10 个事件脚本生成 3 分钟短剧时,系统实时检测 事件间逻辑冲突、角色与场景割裂 等问题,提示修正,使单次生成可采纳率从 35% 提升至 72%,显著降低重复生成成本。
局限
- - **基准覆盖范围的局限性**:LongAV-Compass 包含 284 个测试用例,覆盖 T2AV、I2AV、V2AV 三种模态,但场景和事件多样性仍然有限。分钟级音视频生成涉及复杂的多事件叙事、长程依赖和物理一致性,而当前的测试用例数量可能不足以充分探测模型在极端条件下的性能退化。此外,评估维度虽细粒度,但部分指标(如叙事连贯性)高度依赖 MLLM 的判断,存在评分不透明、可复现性风险,且未深入对比不同 MLLM 之间的评分偏差。
- - **评估框架的工程挑战**:框架整合了 MLLM 辅助评估与多种感知度量(DINO-v2, ArcFace, CLIP, ImageBind),但未充分讨论计算开销和实际部署的可行性。处理分钟级视频需要大量推理时间,尤其在评测多个模型时,成本高昂。论文虽然验证了与人类评判的对齐度(Spearman 相关系数),但仅在小规模人类评估上测试,对齐程度的统计显著性可能不充分,尤其对于主观性较强的维度(如风格、创意),MLLM 评估可能无法完全替代人类评委。
- - **模型覆盖面与通用性**:实验在 11 个代表性模型上进行,但主要集中在公开可用的模型或 API,未涵盖正在开发中的前沿长视频生成系统,这可能导致基准的时效性不足。此外,基准设计假设输入提示或参考图像/视频是高质量且无歧义的,但现实应用中常会遇到模糊或低质量输入,而基准未对此进行压力测试。作为纯评估基准,它不提供任何生成模型改进的思路,对于推动长视频生成的核心算法改进贡献有限。