SemComp-Bench: 视频生成中的语义任务完成基准
我们提出语义任务完成视频生成(Semantic Task Completion Video Generation),这是一种面向结果(outcome-oriented)的视频生成任务。在该设定下,任务成功不仅需要达成预期结果,还要求语义接地(semantic grounding),即参考图像与生成结果之间在任务相关的高层语义上保持一致。评估聚焦于生成结果,既不需要展示完整的中间步骤序列,也不要求与参考图像保持传统的外观一致性。 为支持系统化评估,我们构建了SemComp-Data,一个覆盖六个领域的评估数据集。每个实例包含参考图像、详细指令、简短指令以及以结果为中心的视频片段。我们设计了一个可扩展的四阶段流水线,将原始视频转化为标准化的 SemComp-Data 实例。 进一步,我们提出SemComp-Bench评估协议,使用视觉语言模型(VLM)回答结构化二元问题。SemComp-Bench 分别报告OA 分数(结果达成)和GR 分数(生成可靠性)。在代表性视频生成模型上的实验表明,在达成预期结果的同时保持参考图像中任务相关语义接地,仍是一项挑战。
论文精读
TL;DR SemComp-Bench 定义语义任务完成视频生成,用结果达成与语义接地双指标评测,发现现有视频生成模型在兼顾指令结果与参考图高层语义上仍面临挑战。
问题
问题背景
视频生成模型近年在视觉保真度与时间一致性上进步显著,但评测基准仍主要关注像素级相似度、运动平滑度等低层指标,缺乏对任务完成度的直接衡量。
现有方法局限
主流视频生成评测(如 UCF-101、MSR-VTT 类)侧重通用生成质量,采用 FVD、IS 等分布度量,或 CLIP 相似度等外观对齐。这些指标无法判断视频是否达成用户指令中的高层语义目标,例如“将纸钞折成乌龟”。此外,依赖参考图像外观一致性会惩罚合理的无关属性变化(如背景、视角),而忽略任务关键语义的保留。现有指令跟随评测(例如 VideoCon、VBench 部分维度)多关注简单动作或属性编辑,未系统覆盖跨域的任务完成与语义接地,导致模型部署时缺乏可信的能力边界信号。
为什么这个问题难/重要
语义任务完成要求模型同时满足两个潜在冲突的条件:结果达成 (outcome achievement) 与语义接地 (semantic grounding)。模型需理解指令中的高层意图,并保留参考图像中与任务相关的语义属性(如身份、材质、类别),同时允许无关属性自由变化。这一能力对视频生成在交互式内容创作、虚拟试穿、机器人模仿学习等场景至关重要。但现有 VLM 自动评估在判别细粒度状态变化时仍不可靠,人工标注成本高,规模化评测基础设施的缺失是当前视频生成落地的主要瓶颈之一。
行业类比
类似于具身智能中“给定初始状态图像,生成完成任务的操作视频”的评估:不仅动作要合理,结果物品状态必须正确,且不能丢失关键物体身份。
核心洞察
- 语义任务完成视频生成将评价焦点从生成过程的保真度转移到结果达成与语义一致性,重新定义了视频生成 benchmark 的目标。与现有基准(如 VBench、EvalCrafter)侧重视觉质量、时序一致性和文本对齐不同,该任务明确允许忽略中间步骤和外观一致性,只关注参考图像与最终结果之间的高级语义对应,更贴近真实世界任务型视频生成需求,填补了“是否能完成任务”这一维度的评估空白。
- SemComp-Data 通过四阶段策展管线自动从原始视频中挖掘任务状态并生成结构化评估样本,解决了结果导向视频评估数据稀缺问题。该管线包括候选过滤、状态挖掘、视频扩展和指令结构化,覆盖六个领域,每个实例包含参考图像、详细/简短指令和结果中心视频片段。相比人工标注或模板合成,这种范式可扩展且保证任务语义多样性,为后续研究提供了标准化数据基础。
- SemComp-Bench 采用 VLM 回答结构化二元问题,将抽象的语义 grounding 分解为 Outcome Achievement 和 Generation Reliability 两个可量化指标,实现了无需人工评估的自动化评测。与依赖人类主观评分或复杂感知指标相比,该协议通过二元问题降低 VLM 判断歧义,并分别报告 OA Score 和 GR Score,既衡量结果达成又衡量生成可靠性,提供了更细粒度的诊断信息,便于分析模型失败模式。
方法
方法概述
输入包括参考图像、详细指令、简短指令以及结果中心视频片段。核心流程由四阶段数据构建和基于 VLM 的二元问答评估组成。
SemComp-Data 构建分为四步:
- 候选过滤(Stage 1):基于标题关键词过滤原始视频,筛选语义任务相关片段。
- 状态挖掘(Stage 2):定义参考状态与结果状态,明确任务起止语义。
- 视频扩展(Stage 3):从原始视频中截取聚焦最终结果的结果中心片段。
- 指令结构化(Stage 4):生成详细指令与简短指令,形成标准化评测实例。
SemComp-Bench 评估使用 VLM 对结构化二元问题作答,输出两个指标:
- OA Score(Outcome Achievement):衡量结果是否达成预期任务目标。
- GR Score(Generation Reliability):衡量生成结果与参考图像之间的任务相关高层语义接地,如材质、形状、类别等。
与传统视频生成基准不同,本方法不要求展示完整的中间步骤序列,也不要求与参考图像的外观一致性,仅关注最终结果的任务语义对应。
实验
实验设计
作者在代表性视频生成模型上评估 SemComp-Bench,输入参考图像和指令(详细/简要),生成视频。通过 VLM 回答结构化二元问题,计算 OA Score(结果达成)和 GR Score(生成可靠性)。数据集 SemComp-Data 覆盖六个领域,每个实例包含参考图像、详细指令、简要指令和结果中心视频片段。
关键发现
实验表明,现有模型在实现预期结果的同时保持参考图像的任务相关语义接地仍具挑战。模型在结果达成和生成可靠性上表现不足,表明传统视频生成基准(偏重视觉一致性/时序连贯)未能充分捕捉面向结果的任务完成能力。
与基线对比解读
与常规视频生成评估(如 FVD、CLIP 相似度)相比,SemComp-Bench 聚焦于高层语义的任务完成,不要求完整中间步骤或外观一致性。新基准更贴近真实世界的目标导向生成场景,为模型迭代提供了更细粒度的诊断信号。当前主流模型在语义接地上仍有明显差距,需要显式建模任务语义和参考属性。
行业影响
落地场景
SemComp-Bench 可评估视频生成模型在语义任务完成上的表现,适用于需要精确指令执行的场景:
- 电商内容生成:根据商品图生成“折叠 / 变形 / 组装”等操作视频,当前模型常忽略指令细节或丢失商品关键特征,该基准可作为模型选型与迭代的过滤器。
- 教育 / 培训视频:生成实验操作或设备使用演示,要求步骤正确且器材语义一致。
- 企业服务自动化:生成软件操作演示、产品装配说明等,减少人工录制成本。
商业价值
- 降低生成后编辑成本:通过 OA / GR 分数自动筛除不达标视频,减少人工审核与重生成开销,预计可降低 20-40% 的后期返工。
- 提升用户信任与转化:在电商、广告等场景,准确执行指令的视频能直接提升点击率与转化率;同时减少误导性内容带来的法律风险。
- 拓展模型应用边界:从通用生成转向任务完成型生成,解锁高价值垂直场景。
与现有工作流接口
- 评估门禁:在视频生成 API 输出后接入 VLM 评估(如 GPT-4V),输出 OA / GR 分数,低于阈值自动重试或告警。
- 模型微调数据筛选:使用 SemComp-Bench 标注的高质量样本构造偏好对,用于 RLHF / DPO 微调。
- CI/CD 集成:作为视频生成模型的回归测试集,监控模型迭代是否损害语义任务完成能力。
原作者指出“achieving intended outcomes while maintaining task-relevant semantic grounding remains challenging”,该基准为工业界提供了量化这一差距的工具。
局限
- - 数据规模与领域覆盖有限:**SemComp-Data** 仅包含六个领域,且每个领域的实例数量未公开,可能导致评估结果的统计可靠性不足;数据构建依赖四阶段人工流水线,成本较高且难以扩展到新领域,限制了基准的长期可持续性。
- - 评测协议依赖 VLM 的主观判断:**SemComp-Bench** 使用 VLM 回答结构化二值问题,虽然设计为客观,但 VLM 本身存在偏见与不确定性,可能影响 **OA Score** 和 **GR Score** 的稳定性;二值判断粒度较粗,无法区分不同程度的语义偏差,也难以捕捉生成视频中的细微瑕疵。
- - 任务定义与实际应用存在差距:该基准仅关注最终 outcome 和 semantic grounding,忽略 intermediate steps 和 appearance consistency,这可能与用户对指令视频的期望不符(用户通常希望看到完整动作序列和外观一致性);与现有视频生成基准(如 **VBench**、**EvalCrafter**)相比,缺乏对通用生成质量(运动平滑度、视觉保真度、时序一致性)的全面评估,限制了基准的全面性。