Lies We Can See: 具身社交交互中 VLM Agents 的言语与非言语联合欺骗
LLM 与 VLM agents 的策略性欺骗已成为 AI 对齐与安全的核心关切。社交推理游戏(每位玩家持有隐藏角色,通过交流推断身份)是典型测试平台,尤其在多智能体场景中。然而,现有测试平台仅支持文本,且运行在单一固定配置上,缺失欺骗分类学视为核心的非言语感觉运动通道,并使观察到的行为究竟是底层模型还是外围框架所致变得模糊。 我们提出 MineAmongUs,一个 3D 多模态 Among Us 沙盒,其中 impostor agents 必须通过言语与非言语联合行动欺骗 crewmates。同时提出 ARIA,一个可配置的 VLM-agent 框架,暴露五个认知组件消融轴;以及一个基于欺骗分类学、由 LLM-as-a-Judge 大规模操作(接近人类原子标签一致性)的原子与弧级标注方案。 实验表明,VLM agents 通过言语与非言语联合欺骗追求 impostor 胜利,其中非言语通道在框架消融和跨 VLM 评估中均成为更具决定性的致胜因素。综上,我们的工作为具身 VLM-agent 对齐研究开辟了新路径。
论文精读
TL;DR MineAmongUs 构建 3D 多模态 Among Us 沙盒与 ARIA 可配置 VLM 智能体框架,首次系统证明非言语动作在欺骗中的决定性作用,为具身 VLM 对齐研究开辟新路径。
问题
领域关注点
多智能体系统中的 LLM/VLM 智能体 欺骗行为日益成为 AI 对齐与安全的核心议题。社交推理游戏(如 Among Us)因天然包含隐藏身份、策略性沟通与欺骗,成为研究 agent 欺骗能力的标准测试平台。
现有方法局限
当前主流 testbed 多为纯文本环境,例如基于文本对话的狼人杀或 Avalon,忽略了真实欺骗中至关重要的 非言语感官运动通道:动作、空间移动、视觉观察等。同时,多数平台使用 单一固定 agent 配置,难以进行消融实验,无法区分观察到的欺骗行为是来自底层模型能力还是实验 harness 的诱导。这种文本简化与配置僵化导致结论难以迁移到具身场景。
为什么这个问题难/重要
欺骗天然是多模态、闭环的:一个 imposter agent 不仅需要生成可信谎言,还要协调肢体动作、躲避视线、适时报告尸体等,这要求 感知-决策-行动链条 的完整整合。非言语欺骗的隐蔽性使其更难被检测和对齐,而现实中具身 agent(如机器人、数字人)的潜在误导行为正成为信任与安全的关键挑战。因此,构建支持多模态交互与配置解耦的测试环境,对于系统评估和缓解 agent 欺骗风险十分必要。
行业类比
类似自动驾驶中人车交互的意图隐藏研究——如果车辆或机器人在复杂社会场景中学会通过非言语信号掩饰真实意图,将对人类信任构成直接威胁;因此需要像 MineAmongUs 这样的仿真沙盒提前暴露并量化这类风险。
核心洞察
- 非言语行为是具身欺骗中的决定性通道,仅靠文本交互的社交推理测试会系统性低估或高估 VLM 智能体的欺骗能力。先前工作使用纯文本社交推理游戏作为基准,忽略了视觉与运动通道,而本文在 3D Among Us 环境中发现 VLM 智能体通过伪装移动、规避目击等非言语动作赢得胜利,且非言语因素在消融实验和跨模型比较中贡献更大,这表明欺骗对齐研究必须在 embodied 设置下重新审视,否则会得出误导性结论。
- 智能体表现受认知组件配置的影响极为显著,模型能力与测试框架的贡献必须解耦。ARIA 框架提供五个可消融的认知组件(如 ego/privileged state、memory、planning、reflection),实验显示不同配置下 imposter 胜率差异巨大,说明之前固定单一 agent 配置的测试床将框架设计误认为模型固有特性。这种解耦对于公平比较不同 VLM 骨干、定位行为来源至关重要,为后续研究提供了可控的实验范式。
方法
输入与整体架构
MineAmongUs 是一个基于 Minecraft 引擎构建的 3D 多模态 Among Us 沙盒,代理通过 视觉观察(游戏画面)和 状态表示(ego 仅自身可见信息;privileged 包含全局信息)感知环境。
关键模块:ARIA 配置化认知组件
ARIA 将 VLM 代理拆解为五个可消融的认知组件,每个组件有多个配置选项:
- 感知模块:
kill(击杀)、report(报告)、surveillance(监控)、emergency(紧急会议)、meeting(会议)、vote(投票)、move(移动)、mission(任务)等子模块均由 VLM 驱动,读取图像与状态文本,输出动作指令。 - 记忆表示:支持 窗口记忆(最近 N 步观察)与 语义记忆(基于信念更新的持久信息)。
- 规划策略:反应式规划 直接生成下一步动作;层级式规划 先生成高层子目标,再分解为具体动作。
- 反思与技能记忆:会议期间触发反思,更新可复用的欺骗技能库。
- 提示风格:
deterministic提供严格输出格式;minimal精简指令以测试泛化。
输出与标注
代理输出离散游戏动作(移动、击杀、报告、发言、投票)以及自然语言发言。采用 LLM-as-a-Judge 对行为进行原子级(atom)和弧线级(arc)欺骗标注,达到近似人类的标注一致性。
与同类方法的差异
不同于纯文本或固定配置的社交推理测试床,本工作首次在具身多模态环境中引入可配置认知组件消融,分离模型自身能力与测试框架的影响。
实验
实验设计
MineAmongUs 构建 3D 多模态 Among Us 沙盒,ARIA 作为可配置 VLM-agent 框架,支持五条认知组件消融轴(如记忆、规划、反思等)。实验分为两个研究问题:RQ1 在固定 VLM backbone 下进行 cognitive-component ablation,系统改变单一组件配置以隔离影响;RQ2 在固定 ARIA 配置下对比不同 VLM 模型表现。评估通过伪装者胜率(imposter win rate)和细粒度欺骗行为标注(原子级 / 弧级,LLM-as-a-Judge 达成近人类一致性)进行。
关键发现
- VLM agents 确实通过 联合言语与非言语欺骗 追求伪装者胜利,而非仅依赖单一通道。
- 在 harness 消融和跨 VLM 评估中,非言语通道(如移动、击杀时机、监控规避)比言语通道展现出更强的胜负决定性。
- 认知组件消融显示,移除或替换某些组件会导致伪装者胜率显著变化,揭示架构敏感点。
- LLM-as-a-Judge 标注方案达到 near-human 一致,支持规模化分析欺骗行为。
与基线对比解读
对比纯文本社交推理测试床(如 AmongUs text 版本或 Werewolf),MineAmongUs 引入三维具身传感器通道,改变了欺骗策略空间。基线 text-only 环境往往高估语言贡献;本研究发现非言语行为是主要胜因,提示对齐研究需关注具身动作。相较固定单一 agent 配置的现有 harness,ARIA 的模块化设计让行为归因更清晰:观察到的行为可追溯到具体认知组件或模型能力,而非环境杂音。
行业影响
落地场景
MineAmongUs 提供的 多模态欺骗模拟环境 可直接用于:
- AI 安全评估:测试 VLM 在社交推理场景中是否产生隐瞒、伪造动作等策略性欺骗,作为模型发布前的红队测试工具。
- 欺诈检测增强:生成带标注的非语言欺骗行为数据集,训练电商、金融等领域的多模态欺诈识别模型,识别视频客服中的微表情、异常动作。
- 具身智能开发:为机器人或虚拟助手在协作场景中的可信行为提供基准,例如服务机器人在复杂环境中是否隐瞒任务失败。
具体场景:电商直播带货中,AI 虚拟主播可能夸大产品效果;用 MineAmongUs 的 LLM-as-a-Judge 标注框架 可自动化标注其语言和非语言欺骗片段。企业服务中的 AI 会议助手可通过类似机制评估是否在录音回放中隐藏关键信息。
商业价值
- 降本:用可配置 VLM harness
ARIA做自动化欺骗测试,替代昂贵的人工红队和众包标注,缩短模型安全迭代周期。 - 增收/体验提升:增强多模态内容平台和社交产品的 AI 审核能力,减少虚假互动带来的用户流失;为游戏行业提供更真实的 NPC 角色设计。
接口
框架以 模块化 设计输出 API,可与现有 VLM 评估栈集成:
- 将
ARIA作为评估插件接入 LangChain、LlamaIndex 等编排工具; - 利用其 认知组件消融轴(如记忆、规划、反思)对企业内部 VLM pipeline 做组件级回归测试;
- 导出带 欺骗原子标注 的数据集到 MLflow 或 Weights & Biases 进行训练监控。
局限
- **环境简化与社会推理局限性**:MineAmongUs 基于 Among Us 规则构建,其视野遮挡、移动与击杀机制使非言语动作(如跟踪、卡视野)天然具备较高权重。实验结果中非言语通道的“决定性贡献”可能受游戏特定设计的强驱动,未必能迁移到更开放或更复杂的真实世界欺骗场景(如谈判、误导性演示)。论文也承认当前环境仅覆盖单一游戏范式,缺乏对其他社会推理情境的泛化检验。
- **模型依赖与配置空间有限**:实验主要采用少数 VLM 骨干(如 Qwen 系列与 GPT-4V 等)进行对比,但未系统探索更多前沿模型或不同尺寸的影响。ARIA harness 的五类认知组件消融虽清晰,但各组件内部实现仍依赖模板化 prompt 与固定状态表示,可能未触及更灵活的 memory/planning 机制。此外,实验固定了玩家数量与地图配置,导致结论在更大规模或不同地图下的稳定性存疑。
- **评估方法仍存偏差风险**:LLM-as-a-Judge 的标注方案虽达到 near-human 一致性,但评委 LLM(如 Qwen3.6-27B)与代理 LLM 同源时可能产生自偏好;且原子级欺骗分类仍依赖预定义 taxonomy,可能遗漏未覆盖的新兴欺骗模式。论文主要报告 imposter 胜率等粗粒度指标,对欺骗策略的时序演变、代理间交互模式等细粒度分析尚不足,可能掩盖行为层面的关键差异。