MNIST-PRO: 重现MNIST作为AI代理的部分可观察世界
AI代理 在部分可观察环境中需要协调主动感知与工作记忆,以维持不断演化的感知状态。然而,现有基准因引入物理和控制复杂性,难以单独评估这种感知状态的构建与解释能力。 为此,我们提出 MNIST-PRO,一个将 MNIST 数字识别转换为带回溯约束的顺序化“瞥视”搜索任务的基准,从而隔离代理感知。我们评估了十种多模态模型,覆盖四种记忆表征:原始视觉历史、文本状态、结构化度量网格图和整合视觉画布。 实验表明,模型在全可观察条件下表现优异,但部分可观察显著暴露性能差距。我们识别出三个关键瓶颈:1. 感知状态构建与解释困难,代理难以整合碎片化瞥视;2. 代理常在完整序列看到前就停止探索;3. 模型即便面对后续矛盾证据,也常未能修正早期错误信念。这些结果显示,仅获取视觉证据不足,代理还必须构建并更新可靠的感知状态。
论文精读
TL;DR MNIST-PRO 将 MNIST 数字识别重构为部分可观测的扫视搜索任务,专门评估多模态模型构建与更新感知状态的能力,揭示其整合碎片化证据、持续探索和修正错误信念方面的显著短板——看到不等于利用。
问题
部分可观测环境 下的 主动感知(active sensing)与 工作记忆 协调,是当前具身智能、视觉导航和远程操作等领域的核心关注点。
现有方法局限:主流视觉语言基准多基于完全可观测的静态图像或视频,不要求 agent 主动选择观察位置;而机器人基准虽涉及部分可观测,但混合了运动控制、物理交互等误差,难以单独归因于感知状态构建失败。这导致“模型能否从碎片化观测中逐步构建并正确解释一个稳定感知状态”这一能力长期缺乏可隔离、可量化的评估手段。
为什么难/重要:真实传感器一次只能捕获局部视野,agent 必须决定下一个观察方向、整合历史信息、并根据新证据更新信念。这一过程要求 主动感知策略、工作记忆表征 与 推理更新 深度耦合。MNIST-PRO 的实验揭示三个典型瓶颈:感知状态构建与解释困难、探索过早终止、面对矛盾证据不愿修正早期错误信念——说明模型可能“看见”却未“用上”证据。这对任何依赖局部观测的自主系统(如巡检、搜救、远程操控)都是关键瓶颈,直接限制 agent 在非结构化环境中的可靠性。
行业类比:类似于自动驾驶在动态遮挡场景中,需要基于有限帧持续构建并更新周围环境表示,而不是假设一次性感知全景。
核心洞察
- 部分可观测性下,感知状态构建(perceptual-state construction)是比单步感知识别更本质的瓶颈,模型即使看到所有片段也无法整合为一致状态。MNIST-PRO 将 MNIST 数字识别转化为序列化 glimpse 搜索任务,消除了导航和物理控制噪声,从而单独量化这一能力。实验表明模型在完全可观测下表现接近上限,但在部分可观测下性能显著下降,且三大失效模式(整合失败、过早终止、拒绝修正)均指向状态维护缺陷而非视觉理解缺陷。与传统 VQA 或主动视觉基准相比,该基准通过 lookback 约束迫使 agent 依赖工作记忆,区分“看见”与“利用”,使感知状态构建可诊断。
- 记忆表示的选择对探索效率和信念修正具有非平凡影响,结构化度量网格图(metric grid map)减少了冗余探索并改善曲线追踪,但并不能自动解决错误信念修正。MNIST-PRO 系统地比较了原始视觉历史、文本状态、网格图和视觉画布四种外部化记忆机制,发现无界视觉历史会过早终止探索,文本状态在多数字序列中发生跟踪漂移,而网格图虽提升空间一致性,但在闭合环拓扑上性能下降。这表明仅增加可视证据数量不足,需要根据任务先验设计记忆的格式和容量,以约束 agent 的感知循环和状态更新策略,为多模态 agent 的记忆架构提供了可验证的工程启示。
方法
输入与任务定义
MNIST-PRO 把 MNIST 数字识别改造成一个部分可观测的序列决策问题。输入不是完整图像,而是 agent 在数字图像上移动注视点获得的局部 glimpse;agent 必须在有限步内选择扫描路径,最终输出数字标签。
关键模块
- POMDP 形式化:状态空间
S包含完整图像与当前注视位置;观测空间O是注视点附近的局部区域;动作空间A允许移动注视点或终止;转移函数更新注视位置;观测函数根据当前位置和lookback 窗口返回 glimpse 序列,控制可回溯记忆的长度。 - agentic loop:每步将当前 glimpse 整合进工作记忆,更新感知状态,然后选择下一个动作;停止后把感知状态解释为数字标签。
- 记忆表示:系统评估四种外部化记忆——原始视觉历史、文本状态、结构化 metric grid map、整合视觉画布;同时考察 native multi-turn 与 autonomous harness 的内部状态构造方式。
- 诊断与压力测试:通过位置精度、精确序列精度、视觉覆盖率、探索深度、数字拓扑复杂度,以及 visual-history horizon 和 glimpse size 两个压力变量,定位失败模式。
输出
最终输出为数字预测和完整交互轨迹,用于区分 看到证据 与 有效使用证据。
与同类工作的差异
相比视觉问答或主动感知基准,MNIST-PRO 剥离物理/控制噪声,专门隔离部分可观测下的感知状态构造与解释能力,并通过可配置 lookback 约束直接操纵工作记忆压力。
实验
实验设计
- 构建 MNIST-PRO:将 MNIST 数字识别改造为序列化 glimpse-based 搜索任务,引入 lookback 约束,形成部分可观测 POMDP。
- 评估 10 个多模态模型,对比 4 种记忆表示:原始视觉历史、文本状态、结构化度量网格图、整合视觉画布。
- 采用 native multi-turn setup,并进行诊断分析和压力测试(视觉历史视界、glimpse 大小)。
关键发现
- 完全可观测下模型表现优异,但部分可观测下出现明显性能差距。
- 三个主要瓶颈:感知状态构建(整合碎片化 glimpses 困难)、过早停止探索(未看全序列)、信念修正失败(面对矛盾证据仍坚持错误)。
- 记忆表示影响显著:结构化空间图 减少冗余探索;无界视觉历史 导致过早终止;文本状态 在复杂任务中轨迹漂移。
与基线对比解读
- 基线为完全可观测设置,揭示性能差距主要源于感知状态构建而非基础识别能力。
- 不同记忆表示的消融表明,更好的表示能提升证据利用效率,但尚无单一表示在所有条件下最优。
- 结果强调:仅获取视觉证据不等于有效感知,需要可靠的状态构建与更新机制。
行业影响
落地场景
MNIST-PRO 虽是 digit 基准,但其核心机制——序列化 glimpse 采集、有限 lookback、显式状态构建——可直接映射到现实中的 主动视觉搜索 与 部分可观测诊断 场景:
- 工业视觉质检:高分辨率面板/晶圆扫描受限于摄像头视场或带宽,需分块采集并维护缺陷位置状态。
- 企业服务中的 UI 自动化 Agent:屏幕分块观察,需要记忆已读区域并整合控件关系。
- 医学影像初筛:滑窗阅片时,病灶在不同 glimpse 之间需要状态累积与信念更新。
商业价值
该基准暴露的能力缺口——“看到≠使用”、过早停止探索、错误信念不修正——正是当前多模态 Agent 在真实业务中导致返工和误判的主因。集成此类诊断指标(如 positional/exact-sequence accuracy、visual coverage 与探索步数)可在研发阶段提前发现模型是否只是“看到”而没有“整合”。对质检、金融文档审核等高容错成本业务,这能降低漏检率、减少人工复核,并支撑以 perceptual-state construction 为核心能力的模型选型。
与现有产品/工作流接口
可以把 MNIST-PRO 作为 模型评估关卡 嵌入 agent 回归测试流水线:
- 将
glimpse size、history horizon参数映射到实际系统(如摄像头裁切尺寸、日志保留窗口)。 - 在 MLOps 平台(如 LangSmith / W&B)中增加“部分可观测感知构建”指标卡,与现有端到端任务分并行监控。
- 对视觉记忆模块,参考论文的 metric grid maps 与 consolidated canvas 实现,作为插件替入现有 VLM 推理循环,对比探索效率与准确率,用于架构选型与提示词调优。
局限
- **任务域狭窄**:MNIST-PRO 将视觉输入限定为 MNIST 数字(0–9),拓扑结构简单、类别数少,无法反映真实场景中的遮挡、视角变化、光照噪声和自然物体识别。部分可观察性通过人工定义的 `glimpse` 和 `lookback` 约束模拟,动作空间离散且状态空间低维,与机器人或具身智能面临的高维、连续传感和控制复杂度差距明显。因此,从该基准得出的模型失败模式(如过早停止探索、信念不修正)可能无法直接迁移到更复杂的视觉任务,外部效度有限。
- **评测对象与记忆表示覆盖不足**:论文仅评估了 10 个多模态模型和 4 种记忆表示(原始视觉历史、文本状态、结构化度量网格图、整合视觉画布),未涵盖外部记忆读写、神经记忆或更丰富的 agent 框架(如 ReAct、tool use)。不同模型的原生多轮设置与 harness 封装差异可能引入混淆变量,影响结论的一致性。此外,开源模型与闭源模型在指令跟随和视觉编码能力上的差距未进行隔离,可能高估了记忆表示本身的作用。
- **POMDP 建模与实际 agent 场景仍存在简化**:尽管论文意图隔离感知状态构建,但状态空间仅为数字类别和位置,转移函数确定性、观察函数固定,缺少动态噪声、遮挡和时变环境。论文发现的“持久记忆没有帮助”可能受到 harness 实现细节或任务规模影响,未在不同任务长度和记忆容量上充分压力测试。缺少与真实部分可观察基准(如 VizDoom、ALFWorld)的交叉验证,结论的稳健性有待进一步检验。