论文

推进大型多模态模型中的创造性物理智能

推进大型多模态模型中的创造性物理智能

大型多模态模型(LMMs)在感知与推理方面取得显著进展,但在开放环境中利用物理可行性进行创造性问题解决仍存在不足。为评估此能力,我们提出 MM-CreativityBench,一个面向可供性驱动的创造性工具使用的基准,包含丰富的视觉和物理约束场景。 实验表明,当前LMMs的关键瓶颈并非生成能力,而是无法持续进行基于视觉证据的探索。模型常忽略相关实体、过度检查关键部件或产生幻觉。为此,我们提出 可供性驱动对齐(Affordance-Grounded Alignment),将创造性工具使用转化为偏好学习问题,采用 直接偏好优化(Direct Preference Optimization)鼓励模型优先选择基于视觉证据的属性-可供性推理。同时,引入可供性知识库监督以引导实体探索和多步规划。 实验结果显示,该方法在选择正确实体和部件方面持续提升,显著减少了幻觉和接地错误。

论文精读

TL;DR MM-CreativityBench 评测多模态模型的创造性物理推理,发现模型常因缺乏视觉接地而失败;提出的 affordance-grounded alignment 通过 DPO 与知识库监督,大幅减少幻觉并提升 grounded 推理性能。

问题

问题背景

大型多模态模型(LMMs)在感知与推理任务中已取得显著进展,但现有评估多聚焦于封闭式的模式识别与问答,较少考察模型在开放式环境中创造性运用物理对象的能力。

现有方法局限

主流基准测试往往要求模型回答预定义的问题,不涉及功能性可供性(affordance) 驱动的探索性工具使用。这导致:

  • 模型无法持续进行基于视觉证据的交互式检查,常忽略场景中的关键实体或部件;
  • 缺乏对“非明显用途”的推断——例如将砖块用作锤子——容易产生幻觉属性,即生成图像中不存在的特征;
  • 训练过程中对齐信号不足,难以抑制幻觉并引导模型关注真实的视觉线索。

为什么这个问题重要且困难

创造性工具使用是物理智能的核心,要求模型不仅理解物体是什么,还要推断其潜在功能并在物理约束下组合使用。这对模型的细粒度视觉理解、多步交互规划以及对物理可行性(如稳定支撑、形状配合)的判断提出了极高要求。失败模式往往不是生成能力不足,而是基础探索不扎实,导致grounding 错误。业界若希望 LMMs 支撑机器人操控、智能助手等应用,就必须解决这类开放式的、基于可供性的推理难题。

行业类比

与机器人领域需要利用环境物体完成任务的场景高度相似——例如 SayCan 中让机械臂拿书垫显示器,但视觉-语言模型若不能脱离统计模式、进行物理层面的创造性推理,则无法胜任此类真实世界的泛化操作。

核心洞察

  • 创造性物理智能的核心瓶颈不是生成能力,而是持续、基于视觉场景的迭代探索。现有基准大多假设问题有明确定义且答案可模式匹配,但 MM-CreativityBench 显示模型在面对开放式工具使用场景时,往往忽略关键实体或局部细节,无法将视觉属性与功能可见性(affordance)动态绑定。这揭示了当前 LMM 在非预设推理中的根本缺陷:它们缺乏对场景进行“主动观察—假设验证—方案组合”的多轮交互建模,而非生成语言或计划的能力不足。
  • 将功能可见性推理与视觉证据直接对齐,通过偏好学习显著降低了幻觉。与依赖外部文本知识库或普通 SFT 的方法不同,本文提出 affordance-grounded alignment,把创造性工具使用重塑为偏好优化问题,利用 DPO 让模型学会偏好在图像中可验证的属性—功能推理,同时引入功能可见性知识库引导探索轨迹。这种以视觉依据为偏好的训练策略,从数据构造到损失函数都强约束生成内容的物理可行性,实验证明它在实体选择准确率和 grounding 错误率上均优于单纯扩大模型或添加文本常识。

方法

输入

  • 场景图像:展示一个物理受限的环境(如缺少特定工具)。
  • 实体视图:场景中候选实体及部件的结构化剪裁图像,提供细粒度视觉信息。
  • 任务:模型需在开放环境中发现如何将实体以非显而易见但物理可行的方式重新利用(创造性工具使用)。

关键模块

1. MM-CreativityBench 构建
  • 可供性知识库:整理实体属性与功能关联,作为任务生成与监督的基础。
  • 反向任务构建:从知识库出发,反向设计需要创造性工具使用的场景,确保任务的开放性与物理约束。
  • 多模态图像生成:通过图像生成技术创建真实场景与实体视图,为视觉推理提供精确 ground truth。
2. 训练轨迹构建
  • 交互轨迹格式:多轮对话式交互,模型需逐步检查实体部件、提问并组合信息,模拟迭代探索过程。
  • 知识引导的探索堆栈:利用可供性知识库监督模型应关注的实体及探索顺序,防止遗漏关键对象。
  • 三分支轨迹采样:生成三类轨迹——正确推理、随机探索和幻觉负例,为偏好学习提供对比数据。
3. Affordance-Grounded Alignment
  • 监督微调(SFT):用正确交互轨迹训练基座多模态模型,建立初步的视觉推理与工具使用模式。
  • 轮次级直接偏好优化(Turn-level DPO):将创造性工具使用形式化为偏好学习问题;对每轮交互,模型需偏好基于视觉证据的属性-可供性推理,而非凭空想象的幻觉推理。
  • 可供性知识库监督:在 DPO 中融入知识库提供的探索广度信号,引导多轮规划,提升对相关实体的覆盖。

输出

  • 模型输出包含选定实体、部件及创新使用方式的解决方案,并附多轮推理链。评估时关注实体正确率、部件选择准确率以及幻觉 / 接地错误减少幅度。

差异点

与常规视觉问答或工具使用基准不同,本方法首次将创造性物理智能建模为偏好学习,直接优化模型的视觉接地性迭代探索行为,而非仅依赖生成式常识推理。

实验

实验设计

  • 基准:MM-CreativityBench, 每个实例提供场景图像、候选实体及其部分的细粒度视图,要求模型通过多轮交互检查场景、识别可供性,并生成视觉与物理可行的解决方案。
  • 评估方式:交互式评估,衡量模型是否迭代探索、正确选择实体/部件、避免幻觉。
  • 训练策略:构建包含知识引导探索栈与三支轨迹采样的训练数据,采用affordance-grounded alignment:结合监督微调(SFT)和 turn-level 直接偏好优化(DPO),并引入可供性知识库的监督,鼓励模型偏好基于视觉证据的属性-可供性推理,抑制幻觉。

关键发现

  • 现有大型多模态模型(LMMs)在创造性工具使用上普遍失败,根源在于无法持续进行 grounded exploration:常忽略相关实体、未充分检查关键部件,或产生图像中不存在的属性幻觉。
  • 经对齐后,模型在选择正确实体与部件上获得一致性提升,幻觉与接地错误大幅降低。
  • 分析表明,细粒度视觉接地仍受限,更高的可供性典型性并不直接带来性能提升,说明物理常识与视觉细节结合仍是挑战。

与基线对比

  • 相比未对齐的 LMMs,对齐后的模型在交互推理中探索效率更高、语义聚焦更准,幻觉类错误显著减少,但部分接地错误仍存。
  • 本研究未提供全局聚合分数,而是在多维度错误类型上进行对比,因此解读需结合论文中的详细错误分析表格。

行业影响

核心场景

MM-CreativityBench 所测试的“基于可供性的创意工具使用”能力,直指视觉语言模型在真实世界交互中的短板。该技术可优先落地于:

  • 电商与内容平台:商品图像创意搭配推荐、短视频拍摄创意生成(如利用日常物件的非典型用法制造视觉亮点)。
  • 机器人操作与自动驾驶:开放环境中物体操作的在线规划与异常处理(如用石头垫稳不平的桌子)。
  • 智能设计工具:如 3D 场景编辑器、家居摆放助手,能根据场景图像主动建议“一物多用”的可行方案。

商业价值

  • 降本:减少视觉创意生成任务中的人工审核与重试成本,尤其在自动化内容生产流水线中,affordance-grounded alignment 通过抑制幻觉显著降低返工率。
  • 增收:创意推荐可直接提升电商转化率与用户停留时长;在内容平台,更丰富的创作辅助功能可拉动创作者活跃度与订阅收入。
  • 体验升级:交互式 Agent 不再仅作标签识别,而是真正理解物体功能边界,提供“物理上可行”的建议,大幅提升用户信任。

集成方式

  • 作为现有视觉语言模型(如 GPT-4V、Gemini-1.5-Pro)的 后训练增强模块,通过 DPO 偏好对齐优化 affordance 推理路径,可包装为 SaaS API 供下游调用。
  • 嵌入 RAG 流水线:将 paper 中构建的 affordance 知识库作为外部检索源,与实时图像编码器输出融合,兼顾灵活性与知识覆盖。
  • 与机器人中间件(如 ROS)结合,提供感知-规划接口,将场景实体与部件可供性直接映射为动作序列。

具体用例

  1. 电商创意搭配:某时尚平台上传一件基础款连衣裙的平铺图,模型不仅识别“腰带、项链”等常规配饰,更能建议“将丝巾折成发带”或“用书页制作不规则胸针”,并生成视觉指引图,有效提升新颖搭配的点击率。
  2. 视频拍摄灵感工具:创作者输入一张杂乱工作室照片,模型基于桌面上的水瓶、笔记本、台灯等物体,输出“利用水瓶作为手机支架延时摄影”的可行步骤,引导产出差异化内容,降低策划门槛。

局限

  • **基准覆盖范围与泛化性受限**:MM-CreativityBench 的构建依赖预定义的 affordance 知识库,任务场景和候选工具均来自该知识库的逆向生成,这限制了基准所能覆盖的创造性工具使用类型的多样性。知识库本身基于人工整理,难以穷尽真实世界中物理交互的丰富性,因此模型在该基准上的表现能否迁移到更开放域的实际任务仍有待验证。此外,基准采用交互式评估,但每轮交互提供的候选实体和部件视图是结构化的,与完全无约束的视觉探索场景存在差异。
  • **方法依赖高质量偏好数据,训练成本高**:提出的 affordance-grounded alignment 方法依赖于通过三支轨迹采样构建的正负样本对,负样本主要来自模型自身生成的幻觉或错误推理。这种构造方式可能导致偏好数据覆盖的错误模式有限,进而限制了模型对未知错误的纠正能力。同时,DPO 训练需要针对每个样本构建多轮交互轨迹,监督信号来自额外的知识库,整个流程涉及数据构造、细粒度反馈获取和奖励建模,实际应用时部署成本较高。
  • **与现有物理推理基准的比较不够充分**:论文主要展示了在 MM-CreativityBench 上的性能提升,但缺乏与已有物理常识推理或工具使用基准(如 Physion、CATER、ToolBench)的系统性对比。虽然创造性工具使用相较于标准物理推理更强调非显式功能发现,但缺少跨基准分析使得方法的相对优势不够清晰,也难以定位该方法在更广泛的物理智能评估谱系中的位置。
论文Cheng Qian2026-05-25原文

相关内容