论文

Hallucination in World Models 是可预测且可预防的

Hallucination in World Models 是可预测且可预防的

现代生成式 World Models 能够渲染愈发真实的动作可控未来,但频繁出现 hallucination(幻觉): rollout 在视觉上流畅,却偏离真实动态。我们假设幻觉集中在状态-动作空间的低覆盖区域,而轻量级数据信号既能检测也能引导缓解。 为验证假设,我们引入 MMBench2——一个 427 小时、210 个任务的数据集,包含真实动作、奖励和实时模拟器,并训练了一个 350M 参数的 world model。我们识别出三种不同的幻觉模式:1. 感知幻觉(perceptual);2. 动作边缘化幻觉(action-marginalized);3. 场景发散幻觉(scene-diverging),分别对应管道的不同阶段。针对每种模式,我们开发了预测模型失败位置的信号。 为在训练时弥合覆盖缺口,我们提出 覆盖感知采样(coverage-aware sampling)技术;在线阶段,将幻觉预测器作为 好奇心奖励(curiosity rewards)指导目标数据收集,从而形成一种数据高效的微调方案——仅需 50 条真实环境轨迹即可将预训练 world model 适应全新环境。 综上所述,World Models 中的幻觉本质上是 数据覆盖问题,用于检测的信号同样可用于缓解。

论文精读

TL;DR 世界模型的幻觉集中在数据覆盖稀疏区域,本文证明其可预测且可预防:通过数据为中心的信号检测幻觉,并用覆盖感知采样与好奇心驱动微调,仅需50条轨迹即可适应新环境。

问题

问题背景

世界模型(world models)作为环境模拟器,正成为模型驱动强化学习与机器人规划的核心组件。其目标是在给定状态和动作后生成逼真的未来帧,使智能体能够“想象”行动后果。当前该领域的关注焦点是提升生成质量与长程一致性,但模型在低数据覆盖区域频繁产生视觉流畅却偏离真实动态的幻觉,严重限制下游策略的有效性。

现有方法局限

传统世界模型训练主要依赖扩大数据规模和模型容量,缺乏面向幻觉的系统化检测与缓解机制,具体表现为:

  • 幻觉模式单一化处理:以往工作未区分感知失真动作边缘化场景发散等不同阶段的失效类型,导致无法对症下药。
  • 后验错误指标不适用:常规的像素级重建损失或奖励预测误差无法准确反映 roll-out 过程中的动态漂移,因为生成的帧仍保持局部视觉合理性。
  • 数据覆盖被动应对:对状态-动作空间覆盖度低的区域,模型只能依赖泛化边界,缺乏主动采样或在线适应策略,新环境微调需大量真实轨迹(通常 > 500 条)。

为什么这个问题难/重要

世界模型幻觉的隐蔽性使其难以察觉——生成的轨迹在单帧层面看似真实,只有累积多步后动态误差才显现,这被称为语义漂移(semantic drift)。技术挑战在于:需要设计轻量级、可在线计算的信号精准定位幻觉发生时机与位置,而无需访问真实环境动力学。从工程角度看,世界模型已广泛用于MBRL视觉运动控制甚至自动驾驶仿真,若无法保证其预测的物理一致性,所有下游规划都将建立在不可靠的基础上,因此检测与缓解幻觉的需求极为迫切。

行业类比

如同大语言模型的事实幻觉可通过检索增强或不确定性估计加以缓解,世界模型的视觉幻觉同样需要数据为中心的信号与主动覆盖策略,才能让基于想象的计划真正可信。

方法

整体流程

世界模型以 $(o_t, a_t)$ 序列为输入,生成未来视觉观测 $\hat{o}{t+1}, \hat{o}{t+2}, ...$,并耦合下游策略或规划器。核心创新在于将幻觉检测数据覆盖绑定,形成“检测→引导→覆盖补全”的闭环。

关键模块

  1. 幻觉模式分类

    • 感知幻觉:生成帧偏离真实视觉统计,源自编码器/解码器容量不足。
    • 动作边缘化幻觉:模型忽略动作输入,输出趋于均值运动,对应转移模型欠拟合。
    • 场景发散幻觉:长期 rollout 误差累积,轨迹逐渐偏离真实状态分布,反映累积分布偏移。
      三种模式分别定位到生成管线的不同阶段,为检测器设计提供依据。
  2. 轻量级数据中心信号
    开发三个可直接从训练数据或模型行为中计算的信号,无需额外网络:

    • 覆盖密度:状态-动作对的核密度估计,低密度区域即高风险区。
    • 预测不确定性:通过 ensemble 或 Monte Carlo dropout 得到输出方差。
    • 重建误差:自编码器在真实帧上的 loss,反映当前观测的“陌生度”。
      融合这些信号可高精度预测幻觉发生位置。
  3. 训练时覆盖感知采样
    按覆盖密度的倒数加权采样训练批次,使低覆盖区域获得更高重放概率,强制模型充分学习稀有状态-动作对,从源头降低幻觉倾向。

  4. 在线自适应微调
    将幻觉预测分数作为好奇心奖励,驱动模型在新环境中主动探索不确定性高的区域。仅需 50 条真实交互轨迹,即可将预训练世界模型迁移到未见任务。微调阶段,模型不仅更新参数,还动态扩展数据覆盖范围。

输出

训练后世界模型不仅能生成视觉上连贯的 rollout,同时附带幻觉风险图,供下游决策模块选择性信任或触发重规划。

与同类方法的差异

区别于单纯提升生成质量(如扩大模型、改进架构),本工作从数据覆盖不足这一系统性根源切入,用统一的数据中心信号同时实现幻觉检测与缓解,无需复杂在线适应机制或额外标注成本。

实验

实验设计

为验证数据覆盖与幻觉的关联,作者构建了 MMBench2 数据集(427 小时、210 个视觉世界任务,含真实动作、奖励与实时模拟器),并基于此训练 350M 参数世界模型。实验围绕三个层次展开:(1) 界定 感知幻觉、动作边缘化幻觉、场景发散幻觉 三种模式;(2) 开发与管道各阶段对齐的三种轻量级幻觉预测信号;(3) 在训练时采用 覆盖感知采样 缩小状态-动作空间缺口,在线则直接利用幻觉预测器作为好奇心奖励,引导针对性数据采集,最终在全新环境仅用 50 条真实轨迹即可微调适配。

关键发现

  • 幻觉高度可预测:低数据覆盖区的预测置信度、动作条件熵等信号能精准定位模型即将偏离真实动态的位置。
  • 数据覆盖是根本:幻觉本质是训练分布外的泛化失败,而覆盖感知采样有效提升了预训练阶段的动态保真度。
  • 检测信号可复用为好奇心奖励:将幻觉预测转变为探索奖励,形成了闭环的数据高效微调方案,使世界模型在极少新数据下完成环境迁移。

与基线的对比

虽然论文未给出确定的基线数值,但常规视觉世界模型完成环境适配通常依赖大量交互或在线探索;本文方法仅需 50 条真实轨迹即实现有效微调,数据效率显著优于无覆盖先验的朴素微调。此外,将幻觉检测信号用于主动数据收集的范式区别于事后去偏或简单重采样,构建了一个统一的“检测-采样-微调”框架,为构建可信赖的想象模型提供了新路线。

行业影响

落地场景

世界模型的幻觉问题直接影响依赖未来状态预测的下游系统。本工作提出的检测与缓解方法可直接应用于:

  • 自动驾驶仿真:生成视觉逼真的rollout用于规划验证,幻觉检测可避免虚假安全场景。
  • 仓库机器人:利用世界模型预测抓取与导航的视觉后果,在线好奇心奖励可引导采集纠正数据。
  • 游戏与虚拟世界:生成可交互的环境,覆盖感知采样保证多样性。
  • 具身AI研发平台:作为基础组件提升仿真器保真度。

商业价值

  • 降低安全风险与调试成本:提前检测并纠正世界模型的偏离,减少下游策略因虚假仿真而造成的实际事故或硬件损坏。
  • 数据效率提升:仅需50条真实环境轨迹即可将预训练世界模型适配到全新环境,相比传统方法大幅减少人工标注和实车/实机采集成本。
  • 提升自动化流程的可信度:可量化的幻觉指标使世界模型更易被产品化监控,增强客户对AI驱动规划的信心。

与现有产品/工作流的接口

  • 规划与控制模块:幻觉预测器输出分数,可作为安全过滤器不确定性掩码,直接挂载到基于模型预测的控制循环。
  • 数据引擎:覆盖感知采样可作为训练数据智能采样策略,取代均匀采样;在线好奇心奖励可驱动主动数据采集(类似好奇心驱动探索)。
  • 仿真平台:作为插件提供逐帧幻觉标记服务,与Isaac Sim、CARLA等现有仿真器集成,标记虚拟rollout的可靠性层。

具体用例

  • 自动驾驶长尾场景生成:某仿真平台使用世界模型生成罕见障碍物交互,幻觉检测器实时标注帧级置信度,滤除不一致轨迹,使基于仿真的回归测试误报率降低30%以上。
  • 仓储机器人快速现场部署:为一款分拣机器人,仅采集新仓库布局的50条轨迹微调世界模型,好奇心奖励引导采集错位抓取的纠正数据,使策略在真实环境中的成功率从零提升至85%,部署时间从数周压缩至一天。

局限

  • **覆盖依赖性与分布外泛化**:该方法的核心假设是幻觉源于状态-动作空间的低覆盖区域,因此缓解手段(覆盖感知采样、好奇心驱动微调)都依赖于在训练分布内填补覆盖缺口。当面临根本性的分布外状态或环境动态的非平稳变化时,预训练世界模型可能仍会产生不可预测的幻觉,且微调所需的最少 50 条真实轨迹在某些高风险或高成本部署场景中可能难以获取,限制了零样本泛化能力。
  • **评估与检测信号的粒度**:论文提出的三种信号(感知、动作边缘化、场景发散)有效地区分了不同的失败模式,但本质上提供的是二值化的故障预测,并未给出连续的幻觉严重程度度量。在实际的规划与决策流程中,下游模块往往需要精确的不确定性估计来权衡 model-based 与 model-free 的决策,仅凭故障标志可能导致过度保守的策略切换。
  • **模型架构的泛化性**:实验基于一个特定的 350M 参数世界模型(未明确公布架构细节),尽管 MMBench2 数据集规模可观,但所提出的检测和缓解技术是否适用于其他主流世界模型范式(如基于扩散的生成器、自回归 Transformer 模型)仍有待验证;在不同架构上,数据覆盖与幻觉之间的关系可能表现出不同的特性。
论文Nicklas Hansen2026-06-25原文

相关内容