论文

MineExplorer: 评估MLLM智能体在Minecraft中的开放世界探索

MineExplorer: 评估MLLM智能体在Minecraft中的开放世界探索

多模态大语言模型(MLLM)在感知、推理和动作生成方面展现出强大能力,但其在动态开放世界中的持续探索能力仍不明确。现有具身和游戏基准常将交互压缩为短视任务,或使成功与领域特定游戏机制纠缠不清。 本文提出 MineExplorer 基准,用于评估 MLLM 智能体在 Minecraft 中的开放世界探索能力。首先筛选依赖 Minecraft 特定知识的原子任务,以更好反映通用开放世界推理;然后围绕 ReAct 风格能力公式 组织基准,将原子任务组合为隐式多跳任务。为构建可靠实例,采用多智能体合成工作流,联合设计任务图、沙箱场景和基于规则的里程碑评估器。人工评估表明,该工作流生成的实例显著优于单智能体基线。 实验发现,开放世界探索仍具挑战:强模型可处理单跳任务,但在长轨迹中需协调隐藏前提时性能骤降。进一步分析表明,任务难度与智能体完成度相关,且更大模型或思考模式未必带来更好性能。代码和数据集见 https://github.com/Jometeorie/MineExplorer。

论文精读

TL;DR MineExplorer 基准在 Minecraft 中评估 MLLM 的开放世界探索能力,通过解耦游戏知识、多跳任务及多智能体合成,揭示模型在长程隐含前提协调下的显著退化。

问题

问题背景

多模态大语言模型 MLLM 在短视界推理与动作生成上进步显著,但其在动态开放世界中的持续探索能力仍不明确,这成为构建通用具身智能体的关键缺口。

现有方法局限

当前具身与游戏基准普遍存在两类局限:

  • 任务设计简化:交互被压缩为短视界原子动作(如单一合成或寻路),或成功判定与 Minecraft 特有机制(如特定合成配方)深度绑定,无法反映开放世界所需的长期规划与隐式依赖推理。
  • 实例构造粗糙:多数基准采用单智能体管道自动生成任务,导致场景逻辑不一致、里程碑评估不可靠。原子任务孤立排列,未建模 多跳依赖,使评测与实际探索能力脱节。

技术挑战与重要性

开放世界探索的核心难题在于:

  1. 智能体需同时调用空间感知、因果推理与长期记忆,在无显式指导时自主发现并协调隐藏先决条件(例如“先获取铁矿才能合成铁镐以开采钻石”)。
  2. Minecraft 作为沙盒游戏,提供近乎无限的状态空间与稀疏奖励,恰好暴露 MLLM 在多步规划与目标分解上的短板。 实验表明,强模型可应对单跳任务,但在 多跳任务(如 MineExplorer 中需协调 3–5 步隐含前置条件的链式任务)中成功率骤降,且模型规模增大、显式思考模式并未稳定带来性能提升。这表明长程协调与隐式目标分解是当前 MLLM 架构的本质瓶颈,直接拖慢其在具身机器人、自主勘探等真实场景的落地。

行业类比

如同家用服务机器人需在未知厨房中自主寻找工具并分步烹饪,MLLM 在 Minecraft 中的探索能力,直接映射到真实世界的自主决策与长程操作。

核心洞察

  • MineExplorer 通过解耦 Minecraft 特定知识与通用世界知识,构建了更“干净”的探索能力基准。多数游戏或具身 benchmark 将任务成功与领域机制深度绑定,导致评测结果难以区分模型是否真正具备开放世界推理,还是仅记住了游戏套路。MineExplorer 先筛选掉依赖游戏特化知识的原子任务,再按 ReAct 式能力维度组合成隐式多跳任务,迫使智能体依靠感知、常识因果与空间关系推进。这种设计让基准更贴近通用 AI 探索能力的评估目标,为评测脱离领域过拟合提供了工程范式。
  • 多智能体合成工作流(Task Selector、Scene Designer、Milestone Evaluator 等)协同生成任务图、沙盒场景与规则化检查器,显著提升测试实例的可靠性,且人工评估优于单智能体基线。该方法将复杂测试构建分解为多角色协作,模拟了真实测试设计中的分工,平衡了自动化效率与实例质量。对工程实践而言,这种合成范式可复用于其他开放环境的大规模评测集生成,降低人工标注依赖的同时保持任务难度和逻辑一致性,突破了以往单模型直出任务实例易出现的模糊、错误或难度失衡问题。

方法

基准构建方法

MineExplorer 的构建围绕三个核心环节:知识解耦能力建模多智能体合成

输入与预处理
从 Minecraft 任务空间中筛选原子任务,通过人工与模型辅助将任务拆分为“世界知识”(一般开放世界推理)与“Minecraft 特定知识”(游戏机制依赖部分),保留前者为主,确保评测聚焦于通用探索能力,而非游戏熟练度。

能力建模
采用 ReAct 风格将开放世界探索阐述为感知、推理、行动三个维度下的细粒度能力(如空间感知、因果推理、移动操作等)。原子任务被组合成隐式多跳任务,这类任务表面只给出最终目标,但需智能体自主识别并完成多项隐藏前置步骤,从而考验长程规划与序列协调。

多智能体合成工作流
为保证任务实例的可靠性与多样性,引入多个专门智能体协同工作:

  • 任务选择器 (Task Selector):基于能力标签选取适合组合的原子任务,构建任务图。
  • 场景设计师 (Scene Designer):根据任务图生成对应的游戏沙盒场景,放置必要方块、实体与初始状态。
  • 里程碑评估器 (Milestone Evaluator):将任务目标分解为一系列基于规则的里程碑指标,例如实体位置、物品栏状态等,用于细粒度进度检测。
  • 验证器 (Validator) 与 Minecraft 专家:交叉校验生成实例的逻辑一致性与可完成性。

该流程通过多轮交互产出任务图 + 沙盒场景 + 里程碑检查器的完整测评实例。人工评估显示,多智能体合成生成的实例在可解性与可靠性上显著优于单智能体基线。

输出
最终构建的 MineExplorer 基准包含覆盖多种感知、推理与行动能力的原子与多跳任务,配套的里程碑评估器支持对智能体轨迹进行细粒度的完成度测量,从而系统评估 MLLM 智能体在开放世界中的持续探索能力。

与现有 Minecraft 或具身智能基准不同,MineExplorer 明确解耦游戏特定知识,并引入隐式多跳任务与基于里程碑的中途评估,从更通用的开放世界推理角度衡量智能体,而非短视距任务成功或游戏技巧。

实验

实验设计

MineExplorer 基准上评估多个前沿 MLLM 智能体,任务覆盖单跳原子任务与多跳组合任务。每个任务实例由多智能体合成管道生成,并配备基于规则的里程碑评估器。评估在 Minecraft 环境中以 ReAct 范式交互:智能体感知视觉与文字状态,生成动作序列。除基本完成率外,还分析了模型规模、是否启用思考模式、环境最大步数以及帧缓冲区大小的影响。

关键发现

开放世界探索对当前 MLLM 智能体仍极具挑战。模型在单跳任务上表现尚可,但在需要协调隐藏前置条件的多跳长程任务中性能急剧下降。进一步分析显示,模型 更擅长感知环境而非逻辑推理,显式的思考过程(如 CoT)或增大参数量并未带来一致的性能提升,甚至可能因规划失误或动作冗余导致性能变差。任务难度与智能体完成率强相关,说明基准能够有效度量能力差异。

与基线对比

该工作使用多智能体合成替代单智能体生成基准实例,人类评估表明前者可靠性显著更高。然而,在实际智能体评估中,更强模型(如更大规模或推理增强)并未表现出压倒性优势,反映出当前开放世界探索任务对稳健闭环策略的需求优先于独立推理能力。这提示未来需更深入耦合感知-推理-行动循环,而非单纯追求模型规模。

行业影响

落地场景

MineExplorer 基准针对开放世界持续探索能力的评估,直接服务于需要长期自主决策的智能体产品。典型场景包括:

  • 游戏 AI 与虚拟世界:如 Roblox、Minecraft 类沙盒游戏中的 NPC,可能需要进行多跳任务(收集材料→合成→建造),该基准可用于筛选能协调隐藏先决条件的模型。
  • 具身智能仿真:家庭服务机器人需要在动态环境中持续导航、搜寻并操作物体,MineExplorer 的 ReAct 式能力拆解 可转化为现实场景的感知-推理-行动评估管线。
  • 交互式内容生成:AI 导演或剧情生成器需在开放世界内规划连贯事件链,基准中的隐式多跳图可测试生成轨迹的逻辑一致性。

商业价值

  • 降本:多智能体合成流程产出高可靠性实例(人工验证显著优于单智能体基线),可自动化生成大量训练与评测任务,减少手工设计成本。将基准集成到 MLLM 迭代中,能更早暴露模型在长时间跨度上的退化,避免在复杂产品中部署后出现意外失效。
  • 体验提升:筛选出能稳定处理多跳推理的模型,可直接提升虚拟助理、游戏伙伴的长期交互质量,让用户感知到“聪明”而非机械的 AI。
  • 增收:对于游戏平台,更智能的 NPC 可提升用户留存与内购;对于企业服务,更强的探索能力使 AI 能在复杂软件界面中自主完成多步操作(如数据分析流),扩大可自动化范围。

与现有产品/工作流的接口

MineExplorer 可作为一个评估微服务嵌入现有 MLLM 开发栈:

  • 训练侧:在模型验证阶段,将 MineExplorer 与常见视觉问答(VQA)或短轨迹基准组合,形成覆盖单跳到多跳的全面评估。
  • 推理侧:通过 API 暴露沙盒环境与里程碑检查器,产品团队可直接对候选模型进行回归测试,确保更新不损害长期探索能力。
  • 工具链:基准提供了 Minecraft 知识过滤,使任务侧重一般推理而非游戏特化知识,便于迁移到其他模拟器(如 Habitat、Unreal Engine),降低与现有仿真平台的适配成本。

具体落地案例

  1. 电商虚拟购物助手:在 3D 虚拟商店中,AI 代理需浏览不同区域、比较商品属性、回忆用户偏好并最终下单,MineExplorer 的多跳任务可检验模型在类似环境中是否保持目标跟踪与库存感知,避免因中间步骤缺失导致错误推荐。
  2. 自动驾驶仿真:车辆在未知城市街区探索,需依据交通标志、动态障碍物做连续决策。MineExplorer 中的空间感知与因果推理评估维度可直接映射到驾驶场景,帮助筛选出能处理长程时间依赖的规划模型,减少仿真到真实环境的差距。

原作者实验显示,当前强模型在单跳任务上表现良好,但在多跳任务上性能急剧下降,凸显该基准对工业级应用的筛选价值。通过将 MineExplorer 作为持续集成的一环,团队可在模型迭代中实时监控探索稳定性,避免在开放世界产品中引入回归缺陷。

局限

  • **领域解耦不彻底**:论文通过过滤过度依赖 Minecraft 特定知识的原子任务来增强泛化性,但隐式多跳任务的组合仍可能迫使模型依赖游戏常识(如物品合成规律、生物行为模式),且基准完全构建于封闭的 Minecraft 沙盒中,难以直接迁移到其他动态开放世界环境(如 Habitat、AI2-THOR)。任务设计虽以能力公式为导向,但场景和目标的多样性仍受限于 Minecraft 固有机制,评估出的探索能力与真实世界中的跨环境泛化之间存在差距。
  • **合成流程的引入偏置**:多智能体合成工作流依赖多个 LLM 实例(Task Selector、Scene Designer、Milestone 等)协同生成任务图与场景,虽经人工验证可靠性优于单智能体基线,但合成代理自身的认知偏置(如对常见任务模式的偏好、对难度梯度的线性假设)可能使生成的基准实例在难度分布和组合多样性上出现系统偏移。此外,里程碑评估器依赖规则匹配,无法灵活衡量探索过程的效率和质量,可能低估模型的渐进学习或迂回探索能力。
  • **评估配置简单,未触及长期探索瓶颈**:实验固定了环境步数上限和帧缓冲大小,缺乏对代理长期记忆、空间导航规划或资源管理等关键能力的压力测试。同时仅评测了少数通用 MLLM 端点(如 GPT-4o、Gemini),未对比专门面向开放世界探索的强化学习或规划器结合方法,导致结论可能局限于特定模型族,难以揭示不同架构范式在开放世界探索中的真实差距。
论文Tianjie Ju2026-05-29原文

相关内容