PAWBench: 我们距离概率对齐的世界建模还有多远?
近期视频生成模型日益被视为世界模型。许多物理过程在相同初始观测和动作下可能产生多种有效演化方式,因此世界模型不仅应再现一条合理轨迹,还应再现可能行为的分布。我们将这种分布层面的要求称为概率对齐 (probabilistic alignment)。然而,现有评估大多考察单条视频的合理性,并未检验重复生成是否恢复正确分布。这引出一个核心问题:当前视频生成器距离概率对齐的世界建模还有多远? 为回答该问题,我们正式将概率对齐形式化为世界模型的分布性标准,并引入基准 PAWBench,用于评估视频生成器作为世界动力学的随机采样器。我们还提出 PAWEval,一种结果层面的协议,可将重复视频 rollout 转换为关于可能物理行为的经验分布。 在 50 个场景和 11 个当前系统中,没有任何模型能在恢复有效行为范围的同时持续匹配参考概率。在确认这一差距后,我们检验语言提示、初始噪声采样或模型训练能否重塑模型的预测分布。我们相信,这项工作可为未来迈向概率对齐世界建模的努力奠定基础。
论文精读
TL;DR 本文提出 PAWBench 与 PAWEval,将世界模型评估从“生成合理视频”提升到“恢复物理行为分布”,对 11 个主流视频生成器测试后,发现无一能同时匹配参考概率与行为覆盖,揭示了概率对齐的关键缺口。
问题
视频生成模型 正被越来越多地视为 世界模型,但许多物理过程存在多种合理的演化方式,因此模型不仅应生成单条合理轨迹,还需恢复给定初始观测与动作下可能行为的分布。
现有评估方法 主要关注单视频级别的合理性,例如 FVD / 人工评分 / 物理一致性指标,这些指标只检验“这一次生成的视频是否真实”,却无法回答“反复采样时模型是否覆盖所有可能且概率校准”。例如,模型可能总是输出某个高概率模态而完全忽略低概率但有效的模态,或在多种模态间均匀采样却与真实分布不符。PAWBench 之前没有基准系统性地测试分布级对齐,导致模型可能通过“单次合理但分布偏差”的方式通过现有测试。
分布级对齐的难点在于:
- 多模态校准:模型需要精确估计条件分布
P(future | state, action),既不能过度集中(丢失有效模态),也不能过度分散(引入无关行为); - 结果级评估:视频像素与高层物理行为之间存在语义鸿沟,需要将重复 rollout 转化为可比较的经验分布(如 PAWEval 的做法),并处理有限样本下的统计误差;
- 模型架构偏置:现有视频生成器的噪声注入与条件机制往往偏向特定模态,难以通过简单提示工程修正。
行业类比:就像自动驾驶系统依赖多模态预测来评估风险,如果世界模型的预测分布偏移,下游规划器可能会对罕见但危险的情况系统性失明。
核心洞察
- **分布级对齐** 首次将视频生成器作为随机采样器来评估,而非仅看单条视频的合理性。现有 world model 基准大多关注个体轨迹的视觉 plausible,但物理过程存在多种有效结果,模型是否复现这些结果的概率分布是更本质的问题。PAWBench 通过重复 rollout 构造经验分布,与参考分布比较,填补了从“单样本合理”到“分布匹配”的空白,直接对应 world model 在规划、模拟中的核心需求。
- **PAWEval** 将视频轨迹映射为离散的物理行为结果,再计算分布校准与覆盖率,绕开了直接比较高维视频分布的困难。这一 outcome-level 协议让评估可扩展、可解释,且能区分模型是“过度自信地只生成某一结果”还是“遗漏了低概率但真实的行为分支”。后续干预实验表明,prompt 工程、噪声耦合或训练分布调整都无法同时修复校准与覆盖率,暗示概率对齐需要从模型架构或训练目标层面重新设计,而非简单的后处理手段。
方法
方法概述
PAWBench 将视频生成器视为世界模型的随机采样器,核心评估其输出分布是否与真实物理过程一致。方法流程:给定初始观测和动作,多次独立采样视频,通过结果读取器将每个视频映射为离散的物理行为标签,汇总得到经验分布,再与参考分布比较。
输入:场景定义为 (初始状态, 动作序列),例如推圆柱体或抛硬币,每个场景具有多个合法结果。参考分布由物理仿真或人工统计确定。
关键模块:
- 场景策划:50 个场景分为 PAW-Calibration(校准任务,要求生成分布匹配参考概率)和 PAW-Coverage(覆盖任务,要求生成所有可能结果)两类。
- PAWEval 读取器:使用视觉语言模型或检测器将视频的最终物理状态自动标注为结果类别。
- 分布评估:计算生成分布与参考分布的校准误差(如 ECE)和有效结果覆盖率。
输出:每个模型在全部场景上的校准得分和覆盖得分,以及失效模式分析。
干预实验:在基线之上,测试三种策略——修改语言提示、改变初始噪声采样(如耦合采样)、调整训练分布——以观察是否能改善概率对齐。
跟同类视频生成评测的差异在于,PAWBench 不评估单视频的真实性,而是把重复生成看作蒙特卡洛采样,直接比较采样分布与参考分布,从而暴露当前模型在分布层面的系统性偏差。
实验
实验设计
PAWBench 包含 50 个场景,覆盖需要分布级预测的物理过程,每个场景定义参考行为分布。使用 PAWEval 协议,对每个场景多次采样视频生成模型(共评估 11 个系统),将生成结果映射为离散行为结果,计算经验分布与参考分布的差异。基准包含两个子任务:校准(判断模型输出概率是否与真实频率一致)和覆盖(判断模型是否生成所有有效行为模式)。此外设计了干预实验:语言提示调整、初始噪声采样耦合、训练分布干预。
关键发现
实验表明,当前视频生成器距离概率对齐还有显著差距:没有任何模型能在全部场景上同时满足参考概率匹配与有效行为覆盖。部分模型在简单场景下可能输出看似合理的单条轨迹,但多次采样后分布偏差明显,例如高概率行为被低估或某些有效模式完全缺失。干预实验初步显示,提示工程可以在一定程度上调整输出分布,但难以精确校准;噪声采样策略对分布多样性有影响;训练数据分布干预则能系统性改变生成行为,但当前数据集中仍缺少对尾部行为的建模。
与基线/同类工作对比
传统视频生成评估(如 FVD、CLIP 相似度)只关注单条视频的合理性,无法揭示模型是否学习了正确的条件分布。与此不同,PAWBench 将模型视为随机采样器,通过大量重复 rollout 评估其预测分布。这揭示了现有模型“单次 plausible 但分布错误”的普遍问题,说明仅优化视觉质量或单样本条件生成不足以作为世界模型。与校准/覆盖的固定动作基准相比,PAWBench 引入场景化物理分布,更加贴近真实世界建模需求。
行业影响
落地场景
PAWBench 直接服务于需要世界模型 的工业场景:自动驾驶仿真(预测不同驾驶策略下的多模态交通流)、机器人操作规划(预测物体受力后的多种运动分布)、交互式内容生成(游戏 / 影视的多结局预渲染)。此外,电商虚拟试穿、医疗手术模拟 等需要物理一致性预测的产品也可使用其评估框架筛选基座模型。
商业价值
- 风险控制: 通过
PAWEval识别模型输出分布与真实物理分布的偏差,降低自动驾驶 / 机器人中因错误单模态预测导致的决策失误。 - 研发降本: 替代传统基于物理引擎的仿真器需要大量人工标注的验证流程,用可重复的分布评估快速筛选视频生成模型。
- 体验提升: 内容平台可依据概率对齐 指标选择能产出用户期望行为多样性的生成模型,避免千篇一律的“平均未来”。
与现有工作流接口
- 将 PAWBench 作为模型评测卡插件,集成进 MLOps 流水线(如加入模型发布前的自动回归测试)。
- 在训练循环中使用
PAWEval的不确定性指标作为辅助损失或早停信号,推动模型输出校准后的分布。 - 与现有视频生成 API(如 Runway、Pika 等)对接,在调用端二次采样并评估分布,作为服务等级协议(SLA)指标。
具体落地 use case:
- 自动驾驶场景生成: 某厂商使用视频生成模型为视觉规划器生成未来帧,用 PAWBench 评估在不同天气 / 路况下“车辆变道”行为的分布覆盖,筛选出能生成合理但多样化轨迹的模型,减少决策系统过拟合。
- 电商虚拟试穿: 平台用生成模型模拟衣物在不同动作下的摆动效果,通过
PAWEval检查输出分布是否覆盖常见姿态(而非只输出固定褶皱),提升用户信任和转化。
局限
- **场景规模与模型覆盖有限**:论文在 50 个场景、11 个系统上展开评估,物理过程多样性和模型代表性仍显不足,难以支撑对开放域世界模型的全面结论。干预实验仅浅层尝试 prompt engineering、initial noise sampling 和 model training,未涉及架构级或训练目标级的改进方向。对实际工程的启示是:当前结论可能无法直接外推到更复杂或更大规模的视频生成系统,需要扩展基准任务类型和模型池。
- **评估协议的信息损失**:PAWEval 采用 outcome-level readout,将完整视频 rollout 压缩为离散行为标签分布,忽略轨迹中间状态的对齐情况。且 outcome 的判定依赖预定义规则或人工标注,可能引入主观偏差,降低基准的可复现性。与直接比较 full trajectory distribution 的方法相比,该协议丢失了过程动态信息,可能低估或高估模型的概率对齐程度,对精细行为差异不够敏感。
- **参考分布的来源与任务覆盖局限**:基准中的参考分布多来自专家设计或简化仿真,其自身可能未校准真实环境动力学,导致评估目标存在偏差。此外任务偏向物体碰撞、运动等可物理验证的场景,缺乏智能体决策、长期规划、多步因果推理等复杂情境,而这些恰是世界模型进入实际应用的关键场景。与现有 single-video plausibility 基准相比,本文虽迈出重要一步,但尚未覆盖世界模型的全谱系能力要求。