RobotValues: 当人类价值观冲突时评估家用机器人
家用机器人通常以任务完成度作为评估标准,但在日常家庭环境中常出现价值观冲突场景,例如机器人需要在人类自主性、效率或社交适当性之间做出权衡。然而,目前缺乏评估机器人价值观偏好的基准。 我们提出 RobotValues 基准,包含 10K 个价值观冲突场景。每个实例由一张真实家庭图像和多个可能动作组成,这些动作优先考虑不同的人类价值观。构建过程包括:LLM 辅助场景生成、利益相关者接地价值观提取、图像生成和自动质量控制。 利用 RobotValues,我们评估了机器人领域常用的视觉语言模型 (VLM),发现模型表现出默认的价值观偏好:优先选择安全和顺应动作,而较少选择隐私优先动作。当指令要求优先处理与自身偏好冲突的价值观时,模型难以覆盖默认行为,80% 的情况下选择了错误动作。 该发现表明,家用机器人的评估不仅应关注任务完成或安全合规,还应衡量在价值观冲突时能否做出合理选择。
论文精读
TL;DR 提出 RobotValues 基准,在 1 万组价值冲突场景中评估家用机器人规划能力,揭示 VLMs 存在默认偏好且难以按指令修正,呼吁评估应超越任务完成度。
问题
问题背景
家庭机器人正从单一任务执行向复杂人机交互演进,业界不仅关注任务成功率,更重视机器人行为与人类价值观的对齐。如何让机器人在日常场景中做出符合人类偏好的决策,成为研究热点。
现有方法局限
当前家庭机器人基准与评估体系主要测量任务完成度(如拾取物体、导航精度)、操作推理(如步骤规划)或安全性(如避障、危险检测),但普遍忽略价值冲突场景。例如,同一清洁任务中,机器人可能面临“高效完成”与“尊重用户隐私”之间的权衡,现有数据集缺乏对这种多维偏好的建模。由于未显式定义和采样价值冲突,评估结果无法反映机器人在真实家庭中的社交合理性与价值敏感决策能力,导致实验室高分模型在实际部署时可能出现行为失当。
技术挑战与重要性
家庭环境中的价值冲突具有上下文依赖性和主观性:同一动作在不同时间、不同家庭成员眼中可能优先于不同价值(如效率、自主性、社交适当性)。构建基准需要可扩展的场景生成、利益相关者中心的价值标注以及视觉-语言联合理解,这远超传统分类或检测任务。此外,当前视觉-语言模型(VLM)在机器人规划中日益流行,它们虽具备常识推理能力,但指令遵循与价值偏好覆盖能力薄弱——论文发现,当明确指示优先某价值时,模型仍会顽固保持默认偏好,错误率高达 80%。这一发现对依赖 VLM 做决策的机器人系统敲响警钟:单纯扩大模型规模或优化任务得分,无法解决价值对齐的深层问题。
行业类比
类似自动驾驶领域的伦理困境基准(如电车难题变体),RobotValues 为家庭机器人提供了标准化的价值权衡测试床,推动从“功能安全”到“价值观安全”的评估范式转变。
核心洞察
- 现有机器人评测基准几乎完全聚焦于任务完成度或安全性合规,但忽略了真实家庭环境中机器人必须处理的价值冲突——例如在自主性与效率之间做选择。RobotValues 首次系统性地构建了包含 10K 实例的价值冲突场景,每个实例都提供多个合理动作分别对应不同的人类价值优先级,这为机器人“价值观对齐”提供了缺失的评测维度,推动行业从“能否完成”转向“能否按价值优先级选择”。
- Vision-language models(VLMs)作为机器人规划核心组件,被发现在价值冲突中表现出强烈的默认偏好(如安全与包容),而对隐私等价值严重忽视。更关键的是,当显式指令要求优先选择与其默认偏好冲突的价值时,模型有 80% 的情况无法覆盖内部倾向,即所谓“价值偏好顽固”。这揭示了当前 VLMs 在道德推理与指令遵循上的根本缺陷,对部署于家庭等开放环境的机器人工程师敲响警钟:仅靠提示工程难以校正深层次的价值选择行为,需要探索新的对齐或规划机制。
方法
RobotValues 基准的构建方法围绕四个核心模块:
1. 输入:基于利益相关者的价值需求与场景种子
- 提取家庭场景中典型用户角色(如老人、儿童、访客)和上下文种子,涵盖厨房、客厅等常见环境。
- 从利益相关者驱动的价值提取(stakeholder-grounded value extraction)出发,整理出多项人类价值观(如自主性、效率、社交适宜性、隐私),形成冲突对。
2. 关键模块:LLM 辅助的场景生成与图像合成
- 场景生成:利用 LLM 根据价值冲突种子自动生成包含任务描述、可选动作和对应价值优先级的文本场景。每个实例给定一个现实家居图像,同时列出多个合理但优先不同价值的动作选项。
- 图像生成:基于场景描述,使用文本到图像模型生成逼真的家居环境图像,再通过自动质量控制过滤不合理的图像(如不符合物理规则或价值语义不一致的样本)。
- 质量保证:设计评判准则(rubrics),由 LLM 评判器自动检查生成图像与场景描述的价值对齐程度,确保每个动作选项明确体现一种价值优先。
3. 输出:价值冲突下的动作选择评估
- 最终基准包含 10K 个价值冲突实例,每个实例由一张图像和一组候选动作构成。评估时,将 VLM 作为机器人规划器,观察其在给定指令下选择哪个动作。
- 在无特殊提示时,模型展现出默认价值偏好(如安全和适应性);当明确要求优先某一冲突价值时,80% 的错误率表明模型难以覆盖自身偏好。
与同类方法的差异:现有机器人评估基准仅关注任务完成度或安全性,而 RobotValues 首次系统引入人类价值观冲突的场景,要求模型在均合理的动作间做出价值权衡,填补了家庭机器人价值对齐测评的空白。
实验
实验设计
构建 RobotValues 基准,包含 10K 个价值冲突场景,每个场景由真实家居图像和多个机器人动作选项构成,每个选项优先不同的利益相关者价值 (如安全、隐私、效率)。评估使用多个主流机器人 VLM,在两种设定下测试:1) 无价值指令,观察模型的默认价值偏好;2) 给定冲突价值指令,考察模型能否按指令覆盖默认偏好。
关键发现
在无指令条件下,模型普遍表现出 安全 (safety) 与 适应性 (accommodation) 偏好,而对 隐私 (privacy) 相关动作的选择不足。当被明确要求优先考虑隐私等与自身偏好冲突的价值时,模型有 80% 的错误率,即无法抑制默认行为。这说明当前 VLM 内化的价值排序非常牢固,简单的提示不足以实现价值重排。
对比解读
现有机器人基准多聚焦任务完成度或安全合规,而 RobotValues 揭示了 价值对齐 的短板。模型在无指令时的价值偏好可视为隐式的 行为基线;当指令与此基线冲突时,模型几乎无法调整,表明其决策逻辑非基于灵活的价值推理。与仅评估任务成功的基准相比,RobotValues 引入了一个新维度:即使所有动作都“可行”,机器人也必须做出符合人类价值权衡的选择。该发现提示开发者在训练阶段需注入更丰富的价值数据或引入更强的对齐机制。
行业影响
落地场景
RobotValues 基准可直接应用于家用服务机器人产品的价值对齐评估与研发迭代,例如扫地机器人、家庭伴侣机器人,也可拓展至酒店/医院配送、零售导览等需处理多目标权衡的服务机器人场景。通过对机器人规划器在隐私 vs 任务完成、自主性 vs 效率等冲突下的决策进行系统化测试,企业能定位模型偏好偏差,优化行为策略,从而让机器人在复杂环境中做出更符合利益相关者期望的行动。
商业价值
- 用户信任与体验提升:当机器人能在自主操作时尊重隐私、社会规范等人类价值观,用户接受度和满意度将显著上升,降低产品退货率。
- 降低事故与合规风险:提前暴露模型在价值冲突场景下的错误倾向(如过度牺牲隐私),可避免上线后引发安全或合规事件,减少法律与公关成本。
- 差异化竞争力:在众多仅强调任务成功率的竞品中,具备价值敏感决策能力的机器人可形成高端卖点,支撑溢价策略。
与现有产品/工作流的接口
RobotValues 可无缝衔接当前机器人软件栈:
- 数据生成阶段:利用项目提供的 LLM 辅助场景生成管线,结合企业自有环境资产快速生成大量带标注的价值冲突样本,减少人工设计成本。
- 评估阶段:将基准作为 VLM 规划器的回归测试集,集成到 CI/CD 流程中,每次模型更新自动输出价值偏好报告与 Bradly-Terry 得分。
- 微调阶段:基于基准中的利益相关者价值标注构造偏好对,用于 RLHF 或 DPO,将价值对齐融入模型训练。
具体落地用例
- 智能家居助手:某品牌家庭机器人需在用户不在家时为访客开门(便利性)或拒绝以保护隐私。通过 RobotValues 构造类似场景测试模型,发现其默认倾向开门而忽略隐私,进而针对性地对 VLM 规划器进行安全微调,最终使机器人能在检测到访客时询问远程用户,平衡自主性与隐私。
- 仓储物流机器人:在仓库中,机器人面临效率(快速送达)与安全(绕行避障)的冲突。引入基准中安全 vs 效率类别的测试样本,对多模态规划模块进行压力测试,发现模型在拥堵区选择冒险穿行,通过重训策略使其在低风险环境下才允许提速,从而降低事故率。
局限
- **数据集构造依赖自动生成管线**:论文借助 LLM 辅助生成场景文本、图像生成模型(如 Stable Diffusion)产生视觉内容,并引入自动质量控制。虽然提高了可扩展性,但生成内容可能包含幻觉、刻板印象或与现实家庭环境的分布偏差,影响评估的生态有效性。作者仅在人工抽检中验证,未系统分析生成偏差如何影响模型决策评估。此外,价值冲突的刻画受限于预定义的值分类法,可能遗漏更细致或跨文化的价值维度。
- **评估形式单一且脱离闭环交互**:当前基准采用选择题方式,要求模型从预定义的若干动作中挑选一个最能体现某价值的选择。这种离散选择范式简化了实际机器人决策的连续性和上下文依赖性,也未考虑动作执行后的环境反馈与动态调整。真实部署中,机器人可能需要在多目标间权衡,而非仅做一次静态判断,因此基准无法全面衡量模型在持续交互中的价值对齐能力。
- **实验范围与泛化性局限**:论文仅在 6 个视觉-语言模型上测试,涵盖 OpenAI、Google、Meta 等系列,但未涉及具身策略模型或经过安全微调的专用家用机器人系统。同时,所有场景、价值观说明均以英语呈现,隐含西方文化背景,对不同社会规范下的价值偏好未做跨语言、跨文化适配。作者也承认尚未在真实机器人上部署验证,因此从 VLM 的离线评估结论到实际机器人行为的迁移存在不确定性。