MuseBench: 面向MLLMs的意图级视听艺术理解基准测试
视听艺术涵盖电影、视觉艺术、舞台表演和游戏设计等创意学科,其意义源于视觉、听觉和叙事元素的刻意组合(如通过幽闭构图放大恐惧,或通过沉默与特写传达悲伤)。真正的艺术理解需超越表象识别,推理创作者的意图。然而,现有多模态大语言模型(MLLMs)基准多侧重感知识别,忽视了对创意意图的推理。 为弥补这一缺口,我们提出Musebench基准,包含4,016道题目,覆盖: 1. 电影艺术 2. 静态视觉艺术 3. 舞台表演艺术 4. 游戏艺术 题目源自超过10K个视频论文(专业解说+视觉演示),采用单选与可变多选形式,并通过四阶段迭代流程(捷径过滤、对抗干扰、专家验证)生成优化。 对28个最先进的MLLMs进行零样本评估,最佳模型准确率仅48.29%,远低于人类专家的87.18%,揭示当前模型在创意领域专业知识的显著不足。
论文精读
TL;DR MuseBench 构建了首个聚焦创意意图理解的视听艺术基准,评估 28 款前沿 MLLM 发现最佳仅 48.29%,远低于人类专家 87.18%,揭示了当前模型在艺术深层推理上的关键短板。
问题
问题背景
多模态大模型在通用视觉问答上进展显著,但艺术理解领域仍以浅层感知为主。当前研究正从物体识别转向语义推理,而影视、舞台、游戏等视听艺术中,创作意图 的理解成为关键缺口。
现有方法局限
现有基准如 A-OKVQA、MMBench 多聚焦于图像内实体识别或简单场景描述,缺乏对“为什么这样表达”的深层追问。它们存在以下局限:
- 问题粒度粗:仅要求识别物体或活动,无视镜头语言、声画对位等专业手法。
- 选项设计简化:多为单一正确选项,忽略艺术分析的多元开放性。
- 数据来源浅表:依赖人工标注的静态图片,缺乏专业评论作为 ground truth,无法校准模型对 创作意图 的推理。
- 评估维度单一:仅用准确率,无法衡量答案中推理链条的连贯性。
为什么这个问题难且重要
艺术理解要求模型同时处理视觉符号、听觉线索、叙事逻辑三者联动,例如“幽闭构图传递恐惧”或“沉默延长悲伤”。这涉及跨模态对齐、抽象语义映射和领域先验知识的融合。技术挑战在于:
- 意图不可直接观测:创作选择无唯一标准,模型需具备类比推理和语境化解释能力。
- 数据稀缺:带专业评论的音视频素材难以大规模收集,且需过滤浅层模式匹配。
- 对抗干扰:艺术家常用反常识手法,模型易被表面对比误导。 业界关注度持续上升,因为理解创意意图将推动 AI 进入影视辅助、游戏叙事、教育评估等高价值场景。
行业类比
类似自动驾驶从标定障碍物到理解交通参与者意图的跨越,AI 艺术理解需从“看到什么”进化到“读懂创作语言”,这要求模型具备领域级“通感”推理。
核心洞察
- 当前多模态大模型(MLLMs)的艺术理解评测大多停留在感知识别层面(如目标检测、场景分类),而 MuseBench 聚焦于意图级推理——即理解创作者为何如此选择视听元素。这一设计将评测从“是什么”推进到“为什么”,精准填补了现有基准(如 ArtBench、VQA-art)在创造性意图分析上的空白,对推动模型从模式匹配迈向深层艺术鉴赏具有明确指向性。
- MuseBench 的数据构建流程独具匠心:以视频论文为知识源,通过剪辑分割、多阶段问答生成及对抗性干扰项注入,并在专家审核下完成三轮迭代。这种管线不仅保障了题目与专业评论的紧密对齐,还通过过滤捷径线索和强制多选等设计,有效抑制了模型依靠表面统计线索答题,使得评测更贴近真实艺术分析所需的细粒度推理。
- 在 28 个当前最强 MLLM 的零样本评估中,最高准确率仅为 48.29%,远低于人类专家的 87.18%,且模型在不同艺术子领域(影视、静态视觉、舞台、游戏)表现差异显著。该结果揭示出当前模型在跨模态创意融合与开放性意图解读上的系统性缺陷,为未来的预训练目标设计、多模态对齐策略以及领域微调方案提供了明确的改进方向。
方法
输入与知识来源
MuseBench 以 视频评论 (Video Essays) 为核心知识源,这类视频将专业的影视/艺术分析与视觉片段并置,天然包含了创作意图的解析。项目首先从 YouTube 等平台策展超过 10K 候选视频,通过关键词拓展与人工审查筛选出高质量内容,确保覆盖电影艺术、静态视觉艺术、舞台表演艺术和游戏艺术四大领域。
关键构建流水线
基准构建围绕一条 四阶段迭代流程,逐步将视频内容转化为结构化的问答对:
阶段 A:片段分割 (Clip Segmentation)
根据评论的叙事节奏自动切分视频为语义连贯的片段,每个片段对应一个分析点(如一段镜头语言或舞台调度)。阶段 B:片段描述 (Clip Captioning)
利用多模态大模型对每个片段进行精细描述,提取视觉元素、听觉元素和创意手法,生成结构化元数据。阶段 C:问题生成 (Question Generation)
基于片段描述和评论文稿,生成意图级别的问题。问题类型混合 单选题 与 可变选项的多选题,以模拟艺术分析的开放性。生成时强制融入对抗性思维,例如要求模型从干扰项中识别最符合创作意图的选项。阶段 D:干扰项生成 (Distractor Generation)
设计 对抗性干扰项:错误选项并非随机,而是基于常见误解、表面相似但意图不符的元素,通过 shortcut filtering 剔除仅靠统计线索即可作答的简单问题,保证题目测试的是真正的艺术推理。质量审查循环 (Quality Review Loop)
所有问题经过专家验证与多轮迭代校验,依据 失败分类法 剔除歧义、知识错误或不具挑战性的样本,最终保留 4,016 道高质量题目。
输出与评估指标
基准最终输出包含 4,016 个精细标注的问答对,每个问题关联艺术流派、意图类型等元数据,并提供人类专家表现基线(87.18% 准确率)。评估时,单选题采用 机会校正准确率 (Chance-Adjusted Accuracy),多选题则结合 精确率、召回率与 F1,以适应不同选项数的公平比较。
方法差异:不同于仅测试感知识别的传统基准(如识别物体或情绪),MuseBench 聚焦于 创作意图推理,迫使模型理解“为何如此表达”,并首次在基准构建中系统融入视频评论这种天然蕴含 expert commentary 的媒介。
实验
实验设计
MuseBench 包含 4,016 个问题,覆盖 电影艺术、静态视觉艺术、舞台表演艺术、游戏艺术 4 大领域,源自超过 1 万候选视频论文——这些论文配有专业解说与视觉演示。基准混合了 单选题 和可变选项的 多选题,以捕捉艺术分析的开放性。所有题目通过 四阶段迭代流水线 生成:捷径过滤 → 对抗性干扰项构造 → 专家验证 → 质量审查。评估在 零样本 设定下进行,涵盖 28 个当前最强 MLLM(开源与闭源),指标包含 chance-adjusted accuracy、precision/recall/F1,并基于人类专家评测提供 upper bound。
关键发现
- 最佳模型准确率仅 48.29%,远低于人类专家的 87.18%,差距达 38.89 个百分点。
- 多选题 对模型尤具挑战,揭示其开放艺术推理的不足。
- 领域分析表明,模型在需要融合 视听线索 与 创作意图 的题目上尤为薄弱(如识别镜头语言、剪辑节奏、色彩象征),普遍依赖表面语义匹配,缺乏深层创作逻辑。
- 错误分类显示,模型常被 对抗性干扰项 欺骗,未能区分表面相似但意图迥异的艺术选择。
与基线对比的深度解读
以人类专家为 gold standard,现有 MLLM 在“为何这样创作”意图级理解上存在本质缺口。过去基准多衡量感知识别(物体、动作),MuseBench 首次系统衡量创作意图推理。即使最强模型,其表征仍偏向通用视觉语义,对 领域艺术知识(如电影语法、游戏叙事设计)覆盖不足。这指明未来方向:需引入 结构化艺术本体知识、创作过程建模 以及更丰富的 视听对齐预训练,方能缩小与人类鉴赏力的差距。
行业影响
落地场景
MuseBench 瞄准 AI 对影视、静态视觉、舞台与游戏四大艺术门类的意图级理解,可以驱动以下产品/业务升级:
- 视频内容平台(YouTube、Vimeo、Netflix)的智能标签与推荐:不仅识别“一镜到底”或“仰角”,更推断导演为何如此构图(制造压迫感、表现孤立),提升推荐的情感精准度。
- 游戏与影视制作管线:在预可视化阶段自动分析分镜脚本的叙事有效性,或在后期自动检测“情绪断裂”片段,辅助剪辑师与美术指导。
- 艺术教育与评论工具:为学员作品提供专业级的创作意图解读,而非仅反馈“构图居中”;可用于 Coursera、Skillshare 等平台的自动作业点评。
- 社交媒体创作工具(如 Canva、Adobe Express):根据用户输入的意境词(“失落”“希望”)推荐与意图匹配的视觉模板,而非纯风格化滤镜。
商业价值
- 降本:自动化人工难以规模化处理的创意审核与标注。例如,游戏公司批量评审过场动画的情感传达,减少 70% 以上的人工初筛时长。
- 增收:平台通过更细腻的艺术内容理解,增强用户沉浸感与粘性。Netflix 若用意图级相似度推荐(“同样用沉默表达悲伤的影片”),可提升长尾内容的发现率,带动订阅。
- 体验提升:AI 创作助手从“工具”进化为“创意伙伴”。例如,Midjourney 等图像生成工具如果理解“用湿漉漉的街道反光表达孤独”,即可把文字 prompt 映射到更准确的艺术语言,降低用户反复调试的成本。
与现有产品/工作流的接口
MuseBench 本身是零样本评测基准,可直接集成进现有 AI 开发与产品 stack:
- 模型评估与微调:作为 huggingface/transformers 生态的一个评估模块(类似 MMLU),指导视觉语言模型在创意领域的优化方向。Github 仓库 提供标准化接口。
- 内容分析管道:在视频平台的内容理解 pipeline 中,增加一个“艺术意图”特征提取节点,输出结构化 JSON(哪些镜头语言表达了什么情绪),与现有标签系统互补,丰富推荐与搜索特征。
- 创作工具插件:作为 Adobe Premiere Pro 或 Blender 的扩展,实时反馈当前场景的意图强度,给出参考案例。API 可设计为接收视频片段或镜头序列,返回意图类别与置信度。
具体落地 Use Case
- 短视频平台影评类内容精准分发:一个模型(如 Video-LLaMA2)经 MuseBench 风格评测后,能理解某个解说视频不仅讲《闪灵》剧情,更解析了“走廊对称构图营造窒息感”。平台可据此将该视频推送给偏好电影语言分析的用户,而非仅依据标签#恐怖片#,提高点击率与观看时长。
- 独立游戏开发中的叙事评估:开发者在 Unity 中拼好过场动画后,通过内嵌的 MuseBench 风格 API 自动诊断:若一个悲伤场景被评估为“平淡”,系统会提示“建议增加特写并降低色调饱和度”,并展示相似处理的成功示例,加快迭代。
局限
- MuseBench 的知识源主要来自英文视频论文,其艺术分析范式与案例多植根于西方影视及视觉文化传统,对东亚、非洲等非西方艺术中独特的意图表达(如留白、节奏型叙事)覆盖不足。这导致基准存在文化偏向,可能误判模型在非主流文化语境下的理解能力。此外,视频论文本身就是包含剪辑与解说的二次创作,其解读带有一定主观性,以此为“创作意图”的代理标签会引入诠释偏差,影响评估的客观性与可复制性。
- 基准虽采用可变选项多选择以贴近开放分析,但本质仍为基于预定义选项的选择题,无法衡量模型在自由文本生成中主动提出、论证创作意图的能力。零样本设定下,不同模型对选项分布的敏感性未被探索,且缺少对领域微调或少量样本提示的学习潜力评估,可能低估了适配后模型的真实水平。同时,当前评估未区分模型是真正推理意图,还是依赖表面统计关联(如特定视觉特征与选项的共现)来作答。
- 实验未对视觉、听觉、文本等模态进行系统消融,难以归因模型的艺术推理能力究竟来自跨模态整合还是单一强模态(如纯视觉识别)。不同开源 MLLM 处理音频的方式差异显著(原生音频输入 vs. 依赖 ASR 转录),这一混杂变量未受控制,可能导致评估实际上比较的是模型的音频处理能力而非艺术理解深度。这削弱了基准衡量“视听艺术意图理解”这一核心构念的有效性。