论文

HarnessEval-W: 世界视觉评估的智能体化评测

HarnessEval-W: 世界视觉评估的智能体化评测

一个基准测试应提供的不只是分数: 使评估值得信赖的是支撑分数背后的推理链条。这对世界模型尤为关键, 因为判断一次 rollout 需要理解物理、因果、世界状态是否演化正确。人类能自然察觉这些违例, 但现有基准无一自动化该能力: 指标大多被暴力计算, 未留下可检查或验证的推理链。 我们提出 HarnessEval-W, 一种智能体化评估流水线, 将 LLM 生态中的 harness 范式引入世界模型基准测试。不同于套用固定评估规则, HarnessEval-W 会解读每个评测案例的上下文, 将评估问题分解为可度量的子问题, 并生成专用子智能体——每个子智能体配备定制上下文与诊断工具, 各自推理所负责的子问题。随后, 父智能体验证收集到的证据, 将其总结为最终结论。该分层流程将每次评估转化为透明的证据树, 完整推理链可证明评测结果。 我们将 HarnessEval-W 应用于 18 个代表性世界模型、330 个评测案例。其判定与人类偏好高度一致, 同时为每次生成的 rollout 提供可验证、细粒度的诊断。我们已开源完整流水线作为实时基准测试, 并邀请社区广泛贡献, 随着世界模型演进共同拓展新技能与评测案例。

论文精读

TL;DR HarnessEval-W 将 LLM 评测的 harness 范式引入世界模型:用层级子 agent 拆解评测问题,生成可验证的证据链与分数,判断与人类偏好高度一致。

问题

问题背景

世界模型评估正在从单纯生成质量转向对物理因果、几何一致性与状态演化的可信判断。

现有方法局限

现有基准如 FVD、PSNR 等多采用暴力计算固定指标,只输出标量分数;无法提供判断分数背后的推理链。对人类可一眼识别出的物理违规(物体穿透、重力异常)、因果错误或世界状态不一致,缺乏自动化诊断能力。评分过程犹如黑盒,结果不可验证,难以定位具体缺陷。

为什么这个问题难/重要

世界模型的 rollout 判断需要理解物理规律、因果链和世界状态是否合理演化,这些子问题相互耦合,单一指标无法覆盖。评估本身必须透明,每个论断要有证据支撑,才能成为技术演进的可信“北极星”。业界需要可审查、可扩展的评估范式,而非又一座标量排行榜。

行业类比

这与 LLM 评估从单一 accuracy 转向带推理的 harness(如 agent-as-judge)的趋势一致,但世界模型额外要求时空推理和诊断工具。

核心洞察

  • HarnessEval-W 将评测从标量分数升级为可验证的推理链,其核心差异在于把 LLM 生态的 harness 范式迁移到世界模型评测,通过层级化子代理生成透明的证据树,使每个评分都能回溯到具体的物理/因果/状态判断,解决了现有 brute-force 指标无法提供推理依据的根本缺陷。
  • 该工作动态分解评测问题而非应用固定 rubric,每个子代理配备定制化上下文与诊断工具,父代理对证据进行验证与汇总,这种分层架构让评测结果不仅与人类偏好对齐,更能输出细粒度诊断,为世界模型的缺陷定位与迭代提供工程可操作的反馈。

方法

输入

HarnessEval-W 以世界模型生成的 rollout(视频序列)与对应的评估案例为输入,评估案例涵盖物理因果、几何一致性、观察真实性等维度。

关键模块

  1. 父代理(parent agent): 负责解释每个案例的上下文,并将总体评估问题分解为一系列可测量的子问题。
  2. 子代理(sub-agents): 为每个子问题生成专门的子代理,每个子代理配备定制化的上下文和诊断工具,独立推理其子问题并收集证据。
  3. 证据验证与汇总: 父代理验证子代理返回的证据的可靠性,并汇总形成最终判断。

输出

整个流程生成一棵透明的证据树(evidence tree),完整记录从子问题到最终结论的推理链,最终输出 verdict 和细粒度诊断报告。

与同类方法的差异

不同于传统基准测试使用固定 rubric 或暴力计算的指标(如 FID、PSNR),HarnessEval-W 通过分层代理分解将评估过程显式化为可检验的推理链,使评价结果更具可解释性和可验证性。

实验

实验设计

HarnessEval-W 在 18 个代表性世界模型 上运行了 330 个评估案例,覆盖物理因果、几何一致性、观察真实感等多个评估轴。每个案例由层次化 agent 流水线处理:父 agent 分解问题,子 agent 分别诊断,最后汇总为证据树。

关键发现

评估结果与人类偏好高度一致,同时提供可验证的细粒度诊断。作者还分析了不同评估轴之间的相关性,以及模型微调后的能力迁移(见论文 5.4 节)。

与基线对比

传统基准(如 FVD、PSNR 等 pixel 级指标)采用 brute-force 计算,无推理过程,导致分数不可解释。HarnessEval-W 将 LLM 生态中的 harness 范式引入世界模型评估,通过透明证据树使每个分数都有推理链支撑,显著提升评估可信度。对于实际工程,该流水线可集成到 CI/CD 中,自动生成细粒度诊断报告,加速模型迭代。开源代码与项目页: GitHub 和 Project Page。

行业影响

落地场景

HarnessEval-W 的可解释推理链评估适合 世界模型 (world models) 与 视频生成模型 (video generation models) 的质量门禁。在自动驾驶仿真中,用于验证预测的未来驾驶场景是否满足物理因果。在内容平台与电商的 AI 生成视频(如虚拟试穿、商品动态展示)上,自动诊断穿模、光影错误等物理不一致缺陷。具身智能仿真也可用它筛选高质量训练数据。

商业价值

传统视频评估依赖人工抽检或标量指标(如 FVD),无法定位具体违规点,导致返工成本高。HarnessEval-W 将评估结果转成可验证证据树,可降低人工审核成本,加速模型迭代;细粒度诊断可指导定向微调,提升生成质量,减少因物理错误带来的合规或品牌风险。对提供模型评测服务的 MLOps 平台,可作为差异化能力直接增收。

与现有工作流集成

HarnessEval-W 作为开源 live benchmark,提供 Python API,可嵌入 CI/CD 流水线,在每次模型训练后自动运行评估并输出证据报告。与现有视频生成框架及评测工具(如 VBench)互补:VBench 提供标量基线,HarnessEval-W 提供归因分析。可通过适配器连接到 MLflow 或 Weights & Biases 等实验跟踪系统,把证据树作为 artifact 存储,实现审计追踪。

局限

  • 依赖多模态大模型判断的可靠性:HarnessEval-W 以 VLM/LLM 作为评估主体,虽然能输出推理链,但模型对复杂物理交互、长时序因果和精细几何一致性的理解仍有限,可能产生视觉误判或语义偏差。这些误判会通过证据树传播,影响最终得分,而当前仅报告与人类偏好的整体一致率,未对细粒度错误类型做充分归因,削弱了评估的可信度。
  • 评估覆盖度与可扩展性有限:当前版本仅覆盖 18 个模型和 330 个案例,评估轴相对固定,难以全面反映世界模型在动作空间、多智能体交互和长时程任务上的表现。分层智能体流程需要为每个子问题生成专用上下文并调用多个子代理,计算开销和延迟显著,不适合高频大规模评测或在线集成到训练循环中。
  • 基准漂移和静态案例的局限性:世界模型快速演进,静态案例容易饱和或被绕过,论文虽提出向自进化 harness 演进,但当前版本仍依赖人工设计案例和专家验证,缺乏自动生成与难度自适应机制。此外,最终 verdict 仍可能被汇总为单一分数,证据树的丰富结构化信息未被充分利用于后续能力诊断。
论文Weiliang Chen2026-08-17原文

相关内容