超越当前观测:在可控非马尔可夫游戏中评估多模态大语言模型
将多模态基础模型部署为闭环策略时,越来越需要基于不再可见的观测来调整动作。然而,现有基准要么暴露完整状态,将隐藏状态重建与其他智能体技能混为一谈,要么仅在一幕结束后测试回忆。 我们引入 RNG-Bench(Reconstructive Non-Markov Games) 基准套件,旨在隔离模型在多步交互中重建过去观测并据此行动的能力。RNG-Bench 包含两个互补游戏:Matching Pairs,要求回忆短暂揭示在特定位置的纸牌身份;3D Maze,需将自我中心视角整合成空间地图。两个游戏在统一框架下沿三个受控难度轴评估:网格大小、视觉模式和观测模态。此外,基准引入逐对对决协议以控制实例级方差,以及 Memory Gap 指标以区分遗忘与不良动作选择。 最困难配置每幕需约128K token和350个图像输入,前沿MLLMs尚未饱和。Memory Gap 分析表明,大多数剩余误差源于遗忘早期观测而非次优决策。最后,在最优策略轨迹和过滤模型演示上微调 Qwen3.5-9B 提升了其在 RNG-Bench 上的性能,并泛化到现有基准而不损害多模态通用能力。
论文精读
TL;DR RNG-Bench 通过可控非马尔可夫游戏,评测多模态模型在闭环决策中记忆并利用历史观测的能力,揭示前沿模型的遗忘瓶颈与微调迁移潜力。
问题
问题背景
多模态基础模型正被越来越多地部署为闭环策略(closed-loop policy),要求模型在交互过程中基于已经不可见的过去观测 做出连续决策。然而,现有基准在评估这一能力时存在明显缺口。
现有方法局限
- 全状态暴露:多数游戏或交互基准(如 GameBench)直接提供完整状态,模型无需主动回忆历史视觉信息。
- 技能混淆:部分任务将隐藏状态重建与其他能力(如规划、推理)捆绑,无法单独衡量“在线记忆与利用”这一维度。
- 离线回忆测试:一些基准仅在完整轨迹结束后要求模型回答问题,无法反映决策过程中实时调用记忆 的真实需求。
技术挑战与重要性
非马尔可夫环境 的决策需要在每个行动步时,根据当前观测推断或重建过去信息,这对模型的长上下文理解、跨回合记忆整合 和多模态对齐 提出了三重挑战:
- 上下文极长:复杂配置下需处理近 128K tokens 和超过 350 张图像。
- 因果推理:必须区分“当前可见”与“仅凭记忆可得的隐藏信息”来指导行动。
- 错误溯源困难:表现差可能是遗忘 或决策不当 导致,现有指标无法解耦。
随着具身智能、可穿戴 AI 代理等场景兴起,对模型在流式视觉输入中维持世界状态 的能力要求越发迫切,这一评估空白直接制约了基础模型在真实闭环系统中的部署可靠性。
行业类比
如同自动驾驶车辆在经过一个交通标识后,即使标识已不在视野内,仍需根据记忆中的限速信息持续调整车速——当前的多模态大模型缺乏对此类视觉记忆驱动决策 的标准化考验。
核心洞察
- **RNG-Bench 专为隔离“记忆驱动控制”能力设计**:通过完全隐藏历史观测、仅允许模型基于当前视野和隐含记忆进行动作选择的非马尔可夫博弈,RNG-Bench 将观测重建与决策规划从其他智能体技能中解耦。与 GameBench 等全状态可见的基准或仅在回放后测试回忆的范式不同,它更真实地模拟闭路策略中部分观测缺失的场景,为诊断多模态模型在长程交互中的记忆瓶颈提供了无混杂的独立评估工具。
- **Memory Gap 指标定量解耦遗忘与次优决策**:该指标通过比较模型动作与最优策略的匹配程度,将错误分解为“遗忘早期观测”和“决策失误”两部分。分析揭示,当前前沿 MLLM 的多数残余失败源于遗忘,而非动作选择不当,这指明了优化上下文记忆架构(而非推理能力)是提升闭路控制成功率的关键突破口。
- **基于最优轨迹与模型演示的 SFT 实现跨基准记忆迁移**:在最优策略 rollout 与筛选后的模型自生成演示上微调 Qwen3.5-9B,不仅使 RNG-Bench 难度配置成功率大幅提升,还将记忆能力迁移至其他多模态基准,且未损伤通用能力。这为低成本合成面向长期依赖的特化训练数据、快速增强闭路策略的记忆鲁棒性提供了可复现的技术路径。
方法
输入与任务定义
模型作为闭环策略,在每个时间步接收当前观测 (o_t)(历史信息被遮挡,需自主记忆),输出动作 (a_t)。任务为多步非马尔可夫博弈,要求模型在交互过程中主动重建不可见状态,而非仅在回合计时后回忆。
环境设计
- 两套互补游戏:
- Matching Pairs:网格中卡片短暂揭示后翻面,模型需记住位置与图案,后续翻开卡片进行匹配。
- 3D Maze:模型以自我中心视图(图像或文本描述)导航,需将局部观测融合为空间地图以找到出口。
- 三维可控难度轴:
grid size(记忆跨度)、visual pattern(视觉复杂度,如简单形状、纹理、自然图像)、observation modality(纯文本、纯图像、图文混合)。最困难配置需约 128K token 上下文和 350 张图像输入,目前前沿 MLLM 尚未饱和。 - Duel 协议(仅 Matching Pairs):两模型在同一局中交替出牌,通过头对头对决消除单局随机种子导致的方差,使评估更稳健。
评估指标与遗忘分解
- Memory Gap:核心创新指标,将总错误分解为 memory gap(未能记住先前观测)与 action gap(记忆正确但动作选择不佳)。通过检查模型是否准确回忆关键观测(如卡片身份、迷宫位置)并与最优策略对比得出。
- 统一 harness:所有游戏在同一框架下自动评估,输出成功率、步数、memory gap 分数等,支持多轮交互的细粒度诊断。
训练与迁移
论文还利用最优策略轨迹与筛选后的模型示范对 Qwen3.5-9B 进行微调,证明该方法不仅能提升 RNG-Bench 性能,还能迁移至现有基准,且通用多模态能力不退化。
与现有可观测状态基准(如 GameBench)相比,RNG-Bench 仅聚焦非马尔可夫场景下的观测重建与记忆决策,通过可控难度与记忆精细指标实现了对模型记忆能力的可分离诊断。
实验
实验设计
RNG-Bench 包含 Matching Pairs 和 3D Maze 两个互补环境,统一控制三个难度轴:网格尺寸、视觉模式、观测模态。评估采用 对决协议 (duel protocol) 以控制实例级方差,并通过 Memory Gap 指标将遗忘与动作选择不佳解耦。测试对象为多款前沿多模态大模型(如 Qwen2.5-VL、GPT-4o 等),在最难配置下每 episode 需处理约 128K tokens 和 350 张图像。
关键发现
- 所有模型在困难配置下均远未饱和,表现出明显的记忆遗忘而非策略不足。Memory Gap 分析揭示大部分残差错误源于对早期观测的遗忘,而非次优决策。
- 微调 Qwen3.5-9B 使用最优策略 rollout 及筛选后的模型演示数据,能显著提升 RNG-Bench 性能,同时迁移至其他非马尔可夫基准时未损害通用多模态能力。
基线对比
与传统视觉对话或全状态暴露的决策基准(如 GameBench)不同,RNG-Bench 将隐藏状态的重建与决策过程紧密结合,避免将遗忘问题混入事后问答。对决协议和 Memory Gap 提供了更细粒度的诊断,展示出当前 MLLM 在闭环控制场景下的核心瓶颈是上下文内对历史观测的组织与保持,而非动作空间的学习。
行业影响
落地场景
RNG-Bench 评估的多模态模型非马尔可夫决策能力,直接对应需要长期记忆的序列交互代理。具体可应用于:
- 电商虚拟导购:用户在多轮对话中提及偏好,模型需跨轮次记忆已看过的商品细节(如颜色、尺码)并据此推荐,而非仅依据当前消息。
- 内容平台交互式叙事:剧情分支游戏或智能客服中,模型需根据先前展示的画面或对话隐藏状态,驱动后续情节或解决方案。
- 自动驾驶/机器人:感知系统需要整合历史观测(例如刚刚经过的路标)来规划动作,即使当前视野中这些信息已消失。
- 企业服务 AI 助手:在长文档分析、多步工作流中,模型需记住之前页面的图表或文本信息来回答后续查询。
商业价值
该基准直接衡量长上下文多模态记忆与决策的可靠性,这关系到:
- 降本:减少因遗忘导致的任务失败和人工重介入,降低运营成本。例如在 AI 客服中,一次性解决率提升可减少转人工比例。
- 增收:更精准的长期记忆能带来个性化推荐转化率提升,或增强付费游戏/应用的用户留存量。
- 体验提升:流畅的跨轮记忆交互是高端 AI 服务的门槛,可成为产品差异化竞争力。
与现有工作流的接口
RNG-Bench 可直接作为模型选择与迭代的诊断工具:
- 集成进 CI/CD 评测流水线:在模型更新前自动跑分,通过 Memory Gap 指标定位是遗忘还是决策问题,指导针对性优化(如增大上下文窗口或改进强化学习)。
- 与 RLHF/DPO 流程结合:利用基准中的最优策略轨迹和模型演示,进行有监督微调(如本文对 Qwen3.5-9B 的操作),可提升记忆能力且不损害通用多模态性能。
- 作为 模型选型参考:对于构建长程交互代理的团队,可直接对比不同模型在可控难度配置下的表现,选择最适合业务场景的基座。
具体落地案例
- 电商直播数字人:虚拟主播需要记住用户几分钟前提到的偏好(如“我要看红色的那款”),而当时展示的红色衣服图片已经滑出画面。模型必须在后续推荐时准确调取该视觉记忆,RNG-Bench 中的 Matching Pairs 任务与此高度相似。
- 智能教育辅导:面向学龄儿童的交互式练习中,AI 导师先后展示地图、图表和问题,要求学生在看不见图表时回答。这对应 3D Maze 任务的空间记忆整合能力,微调后模型可保证辅导节奏的连贯性。
局限
- **任务覆盖面有限:** RNG-Bench 仅包含 Matching Pairs 和 3D Maze 两类游戏,虽然分别覆盖离散卡片记忆与空间导航,但面对真实世界中更复杂的非马尔可夫决策(如动态遮挡、长时跨模态关联)可能仍显不足。论文未在更多环境结构(例如部分可观测的物理推理、多智能体交互)上验证,泛化结论需谨慎。
- **模型泛化验证不足:** 微调实验仅基于 Qwen3.5-9B 单一模型系列,缺乏对 Gemini、GPT-4V 等其他主流 MLLM 架构或不同规模模型的微调分析。因此难以判断所提训练方案是否具有跨架构的鲁棒性,也未能展示不同基座对 RNG-Bench 带来的敏感度差异。
- **计算与推理效率挑战:** 困难配置下每轮需处理约 128K tokens 和 350 张图像,对推理延迟与显存压力巨大。当前主流 MLLM 仍难以承受数百步交互的实时闭环需求,这限制了 RNG-Bench 在低时延应用中的直接指导价值,且论文未给出轻量化或记忆压缩方向的缓解方案。