Affordance20Q: 从物理属性评估可供性推理
可供性推理(从物体的物理属性如形状与材料推断其动作可能性)是人类物理理解的基础,对大型语言模型(LLMs)愈发关键。然而,现有评估基准常暴露物体身份,使模型依赖记忆的对象-可供性映射,而非真正的物理推理。 为弥补此缺陷,我们提出 Affordance20Q 基准——以 20 问题游戏 形式进行,全程不透露物体身份。每局中,模型通过询问物理属性相关的“是/否”问题,从候选集中识别隐藏物体的可供性。该基准涵盖 454 个物体、59 种可供性,共 1009 局游戏,均经人工筛选、精炼与标注。 对 15 个前沿 LLMs 的全面实验显示,模型与人类存在约 20 个百分点的显著差距。基于 KL 散度 的信息增益分析进一步表明,模型在游戏后期未能提出有区分性的问题。为缩小差距,我们开发了 KARI(知识库锚定规则归纳)流水线,基于 LLMs 从知识库生成可供性规则。KARI 将开源 LLMs 的性能提升了最多 15.2 点,但知识库覆盖范围的有限性限制了进一步提升。所有代码及数据见 https://github.com/1171-jpg/Affordance20Q.git。
论文精读
TL;DR Affordance20Q 用 20 问游戏隐藏物体身份,迫使 LLM 基于物理属性推理功能可见性,揭示模型与人类约 20% 的显著性能差距,并引入 KB 锚定的规则归纳法(KARI)来弥合。
问题
问题背景
可供性推理(affordance reasoning)——从物体的物理属性(形状、材质等)推断其可执行的动作——是构建对物理世界有深度理解的 AI 系统的关键能力。随着大语言模型(LLM)在具身智能、机器人规划等领域的应用加速,评估并提升 LLM 的物理常识推理成为迫切需求。
现有方法局限
当前可供性评测基准(如 AGIQA、PIQA 等)存在根本性缺陷:它们显式暴露物体身份(如“杯子”“剪刀”),使模型可以绕过物理属性推理,直接依赖记忆化的物体–可供性映射(memorized object-affordance mappings)作答。
- 表面化评测:模型通过预训练语料中“杯子-盛水”的共现统计即可答对,无需理解“圆柱形+底部封闭”与“盛水”之间的因果关联。
- 缺乏主动式探询:真实场景中,智能体往往需要像玩“20 问”游戏一样,通过主动提问逐步获取物体属性信息,才能推断其可供性。现有基准均不考察这种主动信息获取能力。
- 记忆污染:物体名称本身泄露了大量先验,导致评测无法区分模型是在“推理”还是“回忆”。
为什么这个问题难/重要
原文作者指出:“LLM 与人类表现之间存在约 20 个百分点的显著差距。”
技术挑战源自两方面:
- 物理属性的语言化稀疏性:形状、材质等物理特性在自然语言中往往缺乏精确且统一的描述,模型需要从有限文本信号中构建物理概念。
- 序贯决策与信息增益:在 20 问游戏框架下,模型必须自主选择最具判别力的问题,这要求具备对信息增益(KL 散度)的元认知,而当前 LLM 在此能力上表现不佳——随着游戏进行,模型提问的信息增益下降明显,难以持续提出关键问题。
该问题的重要性体现在 具身智能 与 零样本物体交互 等前沿方向:模型若无法从物理属性推理动作可行性,则无法在未见过的物体上做动作规划,这直接限制了机器人泛化能力。
行业类比
与自动驾驶中的长尾物体检测类似:系统不能只依赖见过**“停止标志牌”的样子,而必须从其“红色八边形”**等物理属性推理出“停止”这一功能可供性,才能在遇到异形或污损标志时做出正确决策。
核心洞察
- Affordance20Q 通过隐藏对象身份的方式重新定义可供性推理评估,迫使模型从物理属性出发进行推断,而非依赖记忆的对象-可供性映射。这使得基准更能反映模型对物理世界的真实理解能力,与现有将对象标签直接暴露给模型的基准形成根本差异,揭示了 LLM 在可供性推理上的实质性缺陷(约 20 点的人类差距),为后续研究提供了更严格的评估框架。
- 基于 KL 散度的信息增益分析揭示了模型在 20 问游戏中提问策略的退化:随着游戏进行,模型难以提出具有高辨别力的问题。这一动态诊断超越了传统的正确率指标,首次量化了 LLM 在主动信息获取上的局限性,为改进问答策略、提升推理效率指明了方向,并解释了模型为何在需要逐步消歧的任务中表现不佳。
- KB-Anchored Rule Induction (KARI) 提出了一种结合知识库与规则归纳的增强方案,它利用知识库中的结构化证据生成可供性规则,再将其注入 LLM 的推理过程,提升了开源模型的性能(最高 15.2 点)。尽管知识库覆盖不足限制了进一步收益,但 KARI 证明了外部符号知识在补充 LLM 的物理推理方面具有潜力,为融合神经与符号方法解决可供性推理问题提供了新思路。
方法
基准构建:Affordance20Q 游戏形式
Affordance20Q 将 affordance 推理转化为20 问题游戏:给定一个隐藏的目标对象,模型需从候选 affordance 集中推断其 affordance,全程不暴露对象身份。每轮游戏包含以下组件:
- 提问者(LLM):根据当前信息提出关于物理属性的二值问题(如“它是刚性的吗?”)
- Oracle:基于知识库回答 Yes/No
- Checker:判断提问者最终猜测的 affordance 是否正确
数据集通过三阶段人工收集管道构建:
- 从 ConceptNet 等知识库抽取对象- affordance 对
- 人工筛选并扩充候选集,确保每个游戏有 4 个迷惑性 affordance 选项
- 人工标注物理属性问题答案,构建 Oracle 知识库 最终得到 1,009 个游戏,覆盖 454 个对象和 59 种 affordance。
增强方法:KB-Anchored Rule Induction (KARI)
针对 LLM 提问缺乏信息量的问题,KARI 管道自动生成基于知识库证据的 affordance 规则,注入提问过程。其流程为:
- Rule Proposer(LLM):给定 affordance,从知识库中检索相关物理属性,生成候选规则(如“可切割的对象通常具有薄而锋利的边缘”)
- Validator:用知识库事实校验规则的正确性与覆盖率
- Auditor:合并并精炼规则集,去除冗余和矛盾 最终产出每个 affordance 的规则集合,供提问者在游戏中使用,以提出更区分性的问题。
KARI 使开源 LLM 性能最高提升 15.2 个百分点,但受限于知识库覆盖度。
与现有 affordance 基准(如 PIQA、ART)不同,Affordance20Q 完全隐藏对象身份,迫使模型摒弃记忆匹配,转而依赖物理属性推理;KARI 则区别于纯 LLM 生成的规则,通过知识库锚定提升规则可靠性。
实验
实验设计
实验围绕 Affordance20Q 数据集展开,该数据集包含 1,009 个 20 问游戏,覆盖 454 个物体和 59 种 affordance。评估对象为 15 个主流 LLM(含开源与闭源),它们在游戏中扮演 Questioner 角色,通过提问物理属性(形状、材质等)推断隐藏物体的 affordance,Oracle 依据知识库回答是/否。人类表现作为参照基线,同时引入 KL 信息增益 (IG) 分析模型提问的区分度。此外,为弥补模型差距,提出了 KB-Anchored Rule Induction (KARI) 流水线,让模型在推理前生成并嵌入来自知识库的 affordance 规则。
关键发现
- 所有 LLM 与人类性能存在 约 20 点 的巨大差距,暴露出现有模型难以仅从物理属性推理 affordance。
- IG 分析显示,模型在游戏后期提问的信息增益显著下降,无法提出针对性问题来有效缩小候选集。
- 集成 KARI 后,开源 LLM 性能提升最高达 15.2 点,但受限于知识库的覆盖程度,进一步提升受阻。
深度解读
传统 affordance 评测中物体身份暴露,模型可依赖记忆的物体-功能映射,但 Affordance20Q 剥离了物体身份,迫使模型进行真实物理推理。结果显示模型缺乏这种能力,即使强如 GPT-4,提问策略也趋于泛化。KARI 通过外部知识库锚定的规则生成,部分弥补了推理缺陷,证明 符号化知识与神经网络的结合是提升物理常识推理的有效路径,但知识库的覆盖边界也划定了当前方法的天花板。未来工作需在更大规模、更多样的知识源上扩展,或探索隐式世界模型来内化物理属性推理。
行业影响
落地场景
Affordance20Q 及 KARI 方法直接服务于具身智能、多模态对话系统和物理世界常识推理增强三大典型场景。
- 机器人抓取与操作:在仓储或家庭环境中,机器人需要判断未知物体的“可抓取性”“可堆叠性”等 affordance,而不仅仅是识别物体身份。Affordance20Q 的问答范式可转化为主动感知策略,指导机器人通过视觉问答逐步推断物体使用方法。
- 智能语音助手与 AR 眼镜:当用户指着陌生物体询问“这能用来开罐头吗?”,系统可利用 KARI 生成的物理属性规则,基于形状、材料等特征完成推理,而非依赖预置的物体功能列表。
- 电商与内容审核:商品上传时的 affordance 属性自动标注(如“可折叠”“防水”)能提升搜索精度;内容平台可借此检测不合规的危险品操作演示。
商业价值
- 降本:减少对大量人工标注的物体-功能映射依赖,通过 KB-Anchored 规则自动生成 affordance 知识,降低知识工程成本。KARI 对开源 LLM 提升 15.2 个百分点的实验结果显示,无需昂贵闭源 API 即可获得显著能力提升。
- 增收:更自然的交互体验可提升智能硬件(如服务机器人、智能音箱)的用户粘性;电商场景中,更准确的属性标签能直接提高转化率。
- 风险控制:内容平台利用 affordance 推理识别危险使用方式,降低合规风险。
与现有产品/工作流的接口
Affordance20Q 及 KARI 可作为评估与增强模块嵌入现有 LLMOps 流程:
- 评估层:将 Affordance20Q bench 接入模型红队测试 pipeline,作为物理常识专项评测。
- 增强层:KARI 管道可集成至 RAG 或知识图谱增强链路,为下游任务提供动态生成的 affordance 规则。
- 数据生成:用 KARI 生成高质量合成数据,微调视觉-语言模型(如 LLaVA、GPT-4V),提升其物理推理能力。
具体落地用例
- 智能仓储机器人:机械臂抓取未知形状零件时,通过“20 问”式交互——先问“是否金属?”“是否有凹槽?”,再判定“可拧紧”或“可插入”,避免仅凭视觉误抓。相比传统只依赖目标检测,该方法对长尾物体的泛化能力更强。
- 直播电商选品工具:卖家上传一款新型厨房用具,系统利用 KARI 规则自动判断“可切剁”“耐高温”等 affordance,生成精准描述,减少人工审核成本并提升搜索曝光准确率。
局限
- **物理 affordance 范围受限**:论文将 affordance 限定在物理属性(形状、材质等)可推断的动作可能性,未能涵盖功能性、社交性或上下文相关的 affordance 类型。数据集包含 59 种 affordance,涵盖面较窄,且对象仅 454 个,可能影响对 LLM 更广泛物理推理能力的评估。
- **纯文本环境的局限性**:基准完全基于文本交互(20 问题游戏),LLM 无法直接感知对象的几何、材质等物理信息,所有物理属性均通过语言描述替代。这种设定可能高估了模型依赖语言线索而非真实物理属性推理的程度,与实际具身场景中的 affordance 推理存在 gap。
- **KARI 方法依赖 KB 覆盖度**:提出的 KB-Anchored Rule Induction 在提升开源模型性能的同时,受限于 ConceptNet 等知识库的覆盖度,对于冷门或长尾对象难以生成有效规则。此外,规则归纳完全由 LLM 执行,可能引入幻觉或逻辑不一致,且未探索如何在不依赖外部 KB 的情况下强化模型自身的物理推理能力。