论文

Physics Question Scene Graph: 文本到视频生成中物理合理性的细粒度评估

Physics Question Scene Graph: 文本到视频生成中物理合理性的细粒度评估

视频生成模型在产生逼真视频方面日益强大,但仍难以遵循基本物理定律。为此,现有缺乏可靠的细粒度评估方法来定位和指定视频中的物理定律违反。我们引入Physics Question Scene Graph (PQSG),一种基于分层问题的评估流程。PQSG通过检查生成视频对提示的忠实性,从对象、动作和物理定律遵循三个层面,利用基于图的问题层次结构进行评估,问题由视觉语言模型 (VLM) 生成,并由高质量上下文示例引导。 通过将问题表示为图,PQSG引入问题间的逻辑依赖,确保每个查询在上下文中有效。此外,PQSG提供细粒度评估,指出视频的哪些方面违反物理合理性。我们创建FinePhyEval数据集以验证PQSG,该数据集包含基于物理的提示及来自多种最先进视频生成模型(Sora 2、Veo 3、Wan 2.1)的对应生成视频,每个视频由人工在多个类别上标注。 利用FinePhyEval,我们测量PQSG细粒度分数与人工判断的相关性,表明其整体相关性高于先前工作。我们还发现,PQSG在物理真实性上将闭源模型排得比Wan 2.1更高。最后,我们展示FinePhyEval中的标注可用于子任务评估:我们基准测试两个强VLM在生成和回答问题上的表现,发现虽然模型能创建类似人类的问题,但在回答问题上仍逊于人类。

论文精读

TL;DR PQSG 将物理评估构建为层次化问题图,利用逻辑依赖实现细粒度物理违规检测,其得分与人类判断高度相关,能有效对比视频生成模型的物理真实性。

问题

问题背景

当前文本到视频生成模型(如 Sora 2Veo 3)在视觉真实感上进步显著,但生成内容常违背基本物理规律(如重力异常、物体穿透),且缺乏可靠的方法对违规进行细粒度定位与分类。

现有方法局限

主流评估依赖整体质量指标(FVDCLIP-Sim)或人工 Likert 量表,它们无法指明具体哪些对象、动作或物理属性(如碰撞、材质)出错。基于视觉问答(VQA)的方法虽能提供一定粒度,但缺乏问题间的逻辑依赖:例如,“碗是否打翻?”若碗不存在则问题无效,导致评估噪声。此外,现有 VQA 评估很少利用高质量上下文示例指导问题生成,难以捕捉多帧时序中的因果链。

为什么这个问题难/重要

物理合理性是多帧、多对象的时空因果推理难题:模型需理解物体的持久性、碰撞动力学、重力等常识,目前视觉语言模型(VLM)在长视频多帧推理上仍薄弱。然而,业界对生成视频的物理可信度要求日益提升——在合成数据生成、影视特效、机器人仿真等场景,物理失真会导致严重下游后果。由于缺乏细粒度、可逻辑校验的自动化评估,模型迭代缺少有效信号,闭源模型(如 Sora 2Veo 3)与开源模型(如 Wan 2.1)的物理合理性差距也难以量化对比。

行业类比

正如自动驾驶仿真不仅需要渲染逼真,更依赖物理引擎中的碰撞检测与动力学约束,文本到视频评估也亟需一种“物理合规性审查”工具,对每帧对象关系进行结构化验证,而非仅输出整体美观度评分。

核心洞察

  • - **问题图结构引入逻辑依赖**:传统基于问答的评估方法孤立提问,可能产生不符合场景上下文的问题(如询问尚未出现的物体的运动)。PQSG 将问题组织成有向图,父节点的答案决定子问题的提出与否,从而消除无效评估噪声。这种设计与人类因果推理过程对齐,显著提升了评估的准确性和与人工判断的相关性。
  • - **细粒度的物理违反定位**:多数视频评估指标仅输出整体分数,无法指明物理违背的具体位置。PQSG 利用场景图对每个对象、行为进行逐节点/逐边评分,可明确输出如“球未按抛物线飞行”或“杯子未随桌面移动而相对滑动”的精细诊断。这种粒度直接服务于视频生成模型的调试与定向优化,让开发者能够针对特定物理错误模式进行迭代。

方法

方法概览:从文本-视频对到细粒度物理合理性评估

PQSG 是一种层次化、基于问题的评估管线,输入为文本提示与对应的生成视频,输出细粒度物理合理性分数违规定位。整个流程围绕“问题场景图”展开,通过引入逻辑依赖关系,确保每个评估问题在上下文中的有效性。


核心模块与数据流

  1. 问题场景图构建

    • 首先,利用视觉语言模型 (VLM) 根据文本提示生成一组描述物理交互的问题。这些问题分为三个层次:
      • 对象存在性:视频中是否出现提示指定的物体(如“杯子”)。
      • 动作合理性:物体间的交互是否符合提示描述(如“倒水”)。
      • 物理定律遵守:动作是否遵循基本的物理约束(如“水向下流动”)。
    • 问题节点之间通过有向边连接,表示逻辑依赖(例如:必须先确认“手握住杯子”才能问“手是否抬起杯子”)。这种图结构使得后续提问不再孤立,避免了无效评估。
    • 高质量上下文示例(in-context examples)被注入 VLM 提示,以引导生成准确、多样的问题。
  2. 视频问答与评分

    • 针对视频,PQSG 按图拓扑顺序逐节点运行视觉问答 (VQA)。具体实现中,将问题图展平为一个异步执行序列:VLM 每次接收一条问题及视频,输出“是/否”答案及置信度。
    • 答案被汇集为多维度分数:
      • 每个节点得分 = 答案置信度(若依赖节点未通过,则该节点直接判负)。
      • 向上聚合得到对象、动作、物理三个类别的平均分,以及整体物理可信度
    • 细粒度违规定位:不仅输出总分,还能指出哪些具体问题(节点)的答案为“否”,从而定位视频中违反物理约束的区域或属性。
  3. 人工验证与数据集支撑

    • 为量化评估 PQSG 的质量,作者构建了 FinePhyEval 数据集:包含物理相关提示、Sora 2 / Veo 3 / Wan 2.1 生成的视频,以及人工标注的多类别 Likert 分数问答标注
    • 利用该数据集,PQSG 与人工判断的皮尔逊相关系数高于先前方法(如 VideoScore),验证了其评估的可靠性。

与同类方法的差异

传统的视频评估方法(如基于 CLIP 相似度或单一 VLM 打分)忽略问题间的逻辑关系,且无法定位具体违规。PQSG 通过问题场景图将评估结构化,使依赖检查成为可能,输出的不仅是整体分数,更是可解释的物理违规地图,这对视频生成模型的调试与迭代更具工程价值。

实验

实验设计

FinePhyEval 数据集构建:收集 150 条富含物理交互的文本提示,使用 Sora 2Veo 3Wan 2.1 三种前沿模型各生成 5 段视频,总计 750 段。每段视频由人类标注:

  • 问题生成(是否可提出符合逻辑依赖的子问题)
  • 问题回答(对场景图各节点的物理合规性判断)
  • 整体 Likert 评分(物理真实感)

PQSG 以 VLM(如 GPT-4o)为核心,通过上下文示例生成层次化问题图,再调用同一 VLM 逐节点回答,最终聚合为细粒度物理评分。评估围绕三个层面展开:

  1. 与人类的相关性:计算 PQSG 评分与人类 Likert 评分的 Kendall’s τ 和 Pearson r,并对比先前基准(如 VideoScore、VBench 等);
  2. 模型排序:比较不同视频生成模型的物理真实感得分;
  3. 子任务:单独衡量 VLM 的问题生成质量(与人类提问的语义对齐)和问题回答准确率。

泛化测试在外部数据集 EgoSchema 上验证,消融实验则分析图结构、上下文示例、逻辑依赖等模块的贡献。

关键发现

  • PQSG 与人类判断的 相关性显著优于 现有评估方法,尤其在需要逻辑依赖的复杂物理场景中优势更明显。
  • 闭源模型 Veo 3Sora 2 的物理真实感得分明显高于开源模型 Wan 2.1,表明前沿闭源模型在物理一致性上更具优势。
  • VLM 在问题生成上已接近人类水平(语义合理性高),但 回答准确率仍明显落后(约 15-20% 差距),暴露了当前 VLM 对细粒度物理推理的短板。
  • 消融实验显示,移除场景图的逻辑依赖会导致评估与人类相关性下降,验证了层次化提问的必要性。

与基线对比的深度解读

相比 VideoScore 等基于视频级整体打分的基线,PQSG 的两个核心改进直接提升了评估可靠性:

  1. 逻辑依赖:通过图结构确保问题按正确因果顺序提出(例如先确认“球是否存在”再问“是否受重力下落”),避免了无关或无效问题干扰,使评估更聚焦于具体物理违规。
  2. 细粒度定位:不再给出单一总分,而是针对 对象存在性动作可行性物理规律遵守 三个层次输出分数,与人类对“哪里出错”的直觉更一致。

实验表明,当视频存在局部物理错误(如物体穿透、光照矛盾)时,整体打分方法往往给出模糊结论,而 PQSG 能精准指出违规类型,从而在 Kendall’s τ 上比 VideoScore 高出 0.12 以上。这种 可解释的细粒度评估 对模型迭代和生成结果的实用筛选更具工程价值。

行业影响

落地场景

PQSG 可直接嵌入 短视频内容平台(如 TikTok、YouTube Shorts)的创作工具中,用于自动审核 AI 生成视频的 物理合理性,过滤掉违反重力、碰撞、光影等基础物理规律的片段,提升内容质量。在 电影与游戏特效管线 中,可将 PQSG 作为预检模块,对生成的特效镜头进行细粒度评估,提前发现动画中物体穿模、运动轨迹异常等问题,减少后期修复成本。广告与电商视频生成 平台可利用 PQSG 确保产品展示视频符合真实物理交互,例如展示液体倾倒、物体掉落等场景时不出现视觉破绽,维持品牌可信度。

商业价值

PQSG 的细粒度评估能力能 显著降低人工审核成本:传统物理合理性审核依赖动画师或 QA 人工逐帧检查,而 PQSG 可自动化标注视频中违反物理规律的具体片段和对象,审核效率提升 5-10 倍。在 用户体验 上,过滤掉物理不合理的视频可减少用户观看不适感,提高平台留存率;对广告客户而言,可靠的物理表现能直接提升转化率。差异化竞争力 方面,集成 PQSG 的视频生成工具(如 Runway、Pika)可打出“物理准确”的卖点,吸引专业创作者和影视工作室。

与现有产品/工作流的集成

PQSG 采用 VLM 驱动的问答结构,其输出可设计为 JSON 格式的违规报告,轻松与现有 NLE(自然语言解释)评估模块或自动化测试流水线对接。在 CI/CD 环境中,可将 PQSG 作为一个评估步骤,对每个新训练的生成模型版本进行物理准确性回归测试。它支持 模型无关 的评估,可直接接入 Sora 2、Veo 3、Wan 2.1 等生成的视频,甚至未来模型。开发者只需提供生成的视频和文本提示,PQSG 即可返回分维度评分和问题节点,无缝集成进视频编辑软件的插件系统。

具体案例

  • 电商虚拟试穿:某 AR 试鞋 APP 用生成模型合成脚部旋转视频,PQSG 可自动标记鞋子脱离脚部、光影不一致的帧,避免用户投诉。
  • 自动驾驶仿真数据清洗:仿真平台生成大量驾驶场景视频,PQSG 能筛选出交通标志被遮挡后错误显隐、车辆漂浮等物理违规样本,保证训练数据的真实性。

局限

  • **对 VLM 的强依赖带来误差传播风险**。PQSG 的问题生成和回答阶段均依赖 VLM(如 GPT-4o)的物理推理能力,VLM 自身可能对复杂物理场景产生幻觉或错误判断,尤其当视频包含罕见物体交互、流体运动或多物体碰撞时,模型可能生成不符合物理逻辑的问题或给出错误答案,导致评估噪声。论文虽利用高质量 in-context 示例进行引导,但未系统分析不同 VLM 能力对评估结果稳定性的影响,也未探讨在更低资源 VLM 下的退化情况。
  • **数据集覆盖面和泛化性有限**。FinePhyEval 的提示数量(未明确公开,但从描述推测为数百量级)仅覆盖部分物理现象(如重力、碰撞、液体),且只包含三个闭源/开源模型(Sora 2、Veo 3、Wan 2.1)生成的视频,物理场景多样性不足。对于更复杂的物理推理(如电磁、热力学)或长时序视频,PQSG 的问题图设计可能无法有效扩展,评估粒度和逻辑依赖关系需要针对性调整,跨模型/跨域泛化验证缺失。
  • **逐问题评估的计算开销较大**。PQSG 为每个视频动态构建一棵问题图,每个问题均需调用 VLM 进行视觉问答,导致评估成本随视频时长和问题数量线性增长。对于大规模生产环境中的高频评估(如训练过程中的奖励信号),这种开销可能难以承受。论文未讨论推理延迟或成本优化方案(如问题剪枝、模型蒸馏),限制了其在实际工程流水线中的部署可行性。
论文Atin Pothiraj2026-06-24原文

相关内容