论文

MindZero: 零标注在线心理推理学习

MindZero: 零标注在线心理推理学习

现实世界的有效辅助需要AI具备强大的心智理论(Theory of Mind, ToM):从人类行为推断其心理状态。当前面临三大挑战:在线推理需对多个假设进行稳健不确定性更新;高效推理需满足实时辅助需求;真实场景缺乏心理状态标注。为此提出MindZero,一个自监督强化学习框架,训练多模态大语言模型(MLLMs)实现高效稳健的在线心理推理。 训练中,模型通过生成心理状态假设获得奖励,这些假设需最大化规划器估计的观测动作似然,类似于模型驱动推理。该方法无需显式心理状态标注。训练后,MindZero将模型驱动推理内化为快速的单次推理。 在网格世界和家庭领域的心理推理与AI辅助任务上评估,结果显示:单独LLM表现不足;模型驱动方法准确率更高但速度慢、成本高,且受限于主干MLLM容量。相比之下,MindZero显著提升了MLLM的内在ToM能力,在准确率和效率上均超越模型驱动方法,表明心理推理可作为一种自监督技能有效学习。

论文精读

TL;DR MindZero 用自监督强化学习训练多模态大语言模型在线推理人类心智状态,无需标注,实现快速单次推理,在准确率与效率上均超越基于模型的方法。

问题

问题背景

AI 智能体要在真实世界中有效协助人类,必须具备稳健的 心智理论(Theory of Mind, ToM) 能力——根据观察到的行为推断用户的意图、目标、信念等不可见的心理状态。

现有方法局限

当前方法主要分为两类:

  • 纯 LLM/MLLM 方法:直接让多模态大模型根据行为序列进行心理推理,缺乏对多假设不确定性的在线更新机制,推理过程不透明且容易产生幻觉。
  • 基于模型的推理方法(model-based ToM):通过显式规划器(planner)评估候选心理状态对已观测动作的解释力,能够稳健地维护多假设信念。但这类方法推理成本极高,每次更新都需要对大量假设运行规划计算,延迟无法满足实时辅助需求;且推理质量受限于 backbone MLLM 的容量,复杂场景下依然不够准确。

此外,真实场景几乎不可能获得高质量的心理状态标注数据,使得监督学习范式难以扩展。

为什么这个问题难/重要

心理推理是 AI 智能体从工具走向伙伴的关键门槛。其难点在于:

  1. 在线性:必须随着新动作不断流入,实时更新对用户心理状态的推断,且要反映合理的不确定性。
  2. 效率与精度的矛盾:精确的模型驱动推理计算开销巨大,而轻量的前向推理又难以维持多假设的信念追踪。
  3. 无标注学习:在缺乏地面真值(ground-truth)的条件下学习心理推理能力,要求模型自主从行为中挖掘隐含信号。

业界对 AI 辅助(proactive assistance) 的需求日益迫切,例如虚拟助手、协作机器人等场景,都要求智能体具备在线心理推理能力。

行业类比

类似自动驾驶系统中的行为预测模块:需要根据车辆历史轨迹在线推断周围驾驶员意图,同时维持多模态不确定性,并在有限算力和延迟下做出安全决策。

核心洞察

  • **MindZero 将昂贵的多步规划蒸馏为单步推理,弥合了效率与准确性的鸿沟。** 与纯 MLLM 基线(缺乏多假设维护和不确定性更新)及基于模型的方法(推理慢、成本高且受限于规划器能力)不同,MindZero 通过自监督 RL 训练,让 MLLM 学会在一次前向传播中直接输出信念状态,其奖励信号源于规划器对观察动作的概率估计,从而无需真实心理标注。这种内化在网格世界和家庭环境任务中实现了准确率大幅超越模型驱动方法,同时将推理速度提升至单步 LLM 级别,为实时 ToM 应用提供了首个可行方案。
  • **自监督 RL 训练使模型习得主动维护多假设与熵驱动的探索策略,无需显式先验。** 论文展示了 MindZero 在在线推理中能自发地保持多种可能目标假设,并利用熵奖励收敛至正确信念,而不是像传统方法那样依赖手工设计的先验分布。这证明心理推理可以作为一项自监督技能被有效学习,且通过简单奖励机制(动作似然 + 熵奖励)即可让 MLLM 涌现出鲁棒的不确定性管理能力,对在动态、未标注的真实世界中构建主动辅助型 AI 助手具有重要启示。

方法

方法概览:从模型推理到内化的单步心理推断

MindZero 采用自监督强化学习范式,训练多模态大语言模型 (MLLM) 执行在线心理状态推理,全程无需显式的心理状态标注。训练完成后,模型将原本依赖规划器 (Planner) 的基于模型的推理蒸馏为快速单次前向预测,显著提升推理效率。

输入与任务定义

模型接收行为观察序列(如网格世界中的运动轨迹或家庭环境中的操作视频)作为输入。任务要求 MLLM 基于观察,在线推断并更新对人类(或智能体)心理状态的信念,输出涵盖目标、信念、偏好等多种假设,并维持不确定性校准(即同时跟踪多个候选假设及其概率)。

关键模块与训练机制

  • 智能体策略 (MLLM Policy): 使用预训练的 MLLM(如 LLaVA 或类似架构)作为主干,在 RL 微调阶段充当策略网络。它接收观测历史与可选的任务提示,直接生成心理状态假设(如目标标签、分布向量)。
  • 奖励设计: 奖励信号由规划器计算。规划器基于候选心理状态假设模拟智能体行为,并评估观察到的实际动作在该假设下的似然。奖励函数鼓励模型产生能最大化动作似然的假设,本质上是将规划器的模型推理能力作为监督信号。
  • 训练目标: 优化最大化期望对数似然,同时引入熵奖励鼓励假设多样性以保持稳健的不确定性更新,以及先验建模项防止过拟合。训练过程中无需任何人工标注的心理状态真值,实现零标注学习。

输出与应用

训练后的 MindZero 模型可直接输出心理状态推断结果,无需再调用规划器,实现实时单步推理。在主动辅助任务中,模型利用推断出的心理状态指导后续辅助动作生成,形成端到端的心理推理─辅助决策流水线。

与同类方法的差异

相较于传统的基于模型的方法(如在线维护规划器并反复计算似然),MindZero 将推理成本从 O(K × planner_cost) (K 为假设数)降为常数级前向传播,大幅提升推理速度且不受主干 MLLM 容量限制;相对于仅靠 LLM 零样本推理,MindZero 通过 RL 内化了结构化推理模式,在准确率与不确定性校准上显著超越。该方法证明了心理推理可作为一种可学习的自监督技能嵌入通用视觉语言模型。

实验

实验设计

作者在 GridWorld(网格世界)和 Household(家庭仿真)两类领域,构造了 Question Answering(心理状态问答)Proactive Assistance(主动协助) 两种任务,测试智能体在线推断人类目标、信念等心理状态的能力。训练采用自监督强化学习,利用规划器估计动作似然作为奖励信号,无需人工标注心理状态。基线包括:纯 MLLM 零样本推理、基于模型的显式推理方法(如 ThoughtTracingAutoToM),以及消融实验(移除先验建模、多假设维持、熵奖励)。

关键发现

纯 LLM 推断心理状态的准确率严重不足,且无法在观测增多时有效更新信念。模型基方法虽能提升准确率,但推理速度慢、计算成本高,且性能受限于底层 MLLM 能力。MindZero 通过 RL 将昂贵、多步的模型基推理内化为单次前向网络传递,在问答与协助任务上均实现准确率与效率的大幅同步提升,证明了心理推理可作为自监督技能被高效习得。

与基线对比的深度解读

模型基方法本质上是对候选心理状态进行在线假设检验,其效果和效率存在根本性矛盾:更多候选状态能提升准确率但带来组合爆炸。MindZero 让 MLLM 直接输出候选状态及其不确定性,跳过了显式搜索,其内部表征已隐式编码了“知觉-行动”耦合关系。这相当于用一次推理替代了模型基方法的多次规划模拟,在实时协助场景中具有决定性优势。实验表明,即使骨干 MLLM 容量有限,MindZero 依然显著超越模型基方法,揭示了学习推断心理状态显式规划推理更高效、更鲁棒。

行业影响

落地场景

MindZero 训练出的 心智推理 (ToM) 能力可直接赋能需要理解用户意图的交互式 AI 产品:

  • 主动式虚拟助手:在智能家居或办公场景中,依据用户连续行为(如走向厨房、打开冰箱)在线推断目标(准备做饭),主动提供菜谱推荐或开启相关设备,而非被动等待指令。
  • 电商与内容推荐:根据用户在商城的浏览、停留、搜索序列,推测购物意图(价格比较、灵感探索或快速复购),动态调整推荐策略并适时提供优惠券,提升转化率。
  • 自动驾驶与机器人:推测行人或协作人的心理状态(过马路意图、下一个操作),实现更安全、自然的决策。
  • 教育辅导系统:根据学生解题步骤和停顿,在线推断知识盲区或解题意图,提供即时且有针对性的提示。

商业价值

  • 体验提升与收入增长:准确的心智推理使 AI 能从“被动应答”变为“主动预测需求”,显著缩短用户达成目标的路径,提升客单价、续订率及用户粘性。
  • 推理成本大幅降低:MindZero 将复杂的 model-based 推理(需多次调用规划器)内化为单次模型前向过程,在保持高准确率的同时将推理速度提升数倍,可直接运行在较弱 GPU 上,大幅降低云端推理成本,使实时 ToM 在边缘设备部署成为可能。
  • 零标注可扩展性:自监督学习框架省去了昂贵的人工心理状态标注,使心智推理能力能快速迁移到任意新领域(金融交易行为分析、医疗问诊意图预测等),降低启动成本。

与现有产品/工作流的接口

MindZero 以 MLLM 微调模块 的形式嵌入现有 AI 堆栈:

  1. 输入:接收行为序列(文本描述或视频帧)作为多模态上下文,无需事先定义目标集合。
  2. 推理:在现有 LLM Agent 框架(如 LangChain、AutoGen)中作为 ToM 组件,在决策前生成多个意图假设及其概率分布供下游策略模块使用。
  3. 部署:支持在线增量更新——新观测到来时,模型在保留历史假设的同时更新信念,无需重跑全部序列,适合流式处理架构。

具体落地用例

  • 电商直播辅助:用户在直播间停留、点击链接、发送评论等行为被实时送入 MindZero 模型,推断用户当前意图(犹豫比价、被主播煽动、需求明确),系统据此触发定制化弹窗(专属折扣、尺码助手),在用户决策窗口期完成转化。
  • 企业级 IT 运维:监控操作员在复杂界面上的点击序列,在线推理其诊断意图(查找错误日志、评估资源瓶颈),主动弹出相关拓扑图或操作历史,减少平均修复时间 (MTTR)。

局限

  • - **训练奖励依赖仿真规划器质量**:MindZero 使用规划器估计动作似然作为奖励信号,规划器本身的准确度会直接影响心智推理的习得效果。尽管实验中采用了基于规则或学习的规划器,但真实人类行为的随机性和多样性可能超出仿真环境的覆盖范围,导致在真实世界部署时出现分布偏移,且论文未分析规划器误差如何向上游传播。
  • - **评估任务和环境较为简单**:当前实验限制在离散动作空间的 gridworld 和 household 场景,任务侧重于短时程的目标推断,未涉及连续控制、部分可观察、多智能体交互等更复杂的情境。这削弱了结论的泛化性证明,难以直接外推至机器人辅助等需要长期在线推理的真实应用。
  • - **训练成本与灾难性遗忘风险**:将 RL 应用于多模态大语言模型需要大量交互和微调,可能带来高昂的计算开销;同时基于奖励的 fine-tuning 可能导致模型遗忘预训练阶段获得的通用语言和视觉能力,论文未提供对遗忘现象的分析或缓解策略。
论文Shunchi Zhang2026-05-29原文

相关内容