SocialReasoning-Bench:衡量AI智能体是否以用户最佳利益行动
这篇研究揭示:当前AI智能体任务执行能力强,但缺乏真正的用户利益意识,即使得到明确指令也未必能做到。
微软研究团队用 SocialReasoning-Bench(一个测试AI代理是否真正为用户利益考虑的基准)发现:各种模型都能熟练执行任务,但即使明确要求它们优化用户利益,它们也常常只完成任务而不会主动改善用户处境。
正文摘录
SocialReasoning-Bench:衡量 AI 智能体是否按用户最佳利益行事 - 来源:Microsoft Research  概览 - AI 智能体正进入社交场景。当智能体代表用户管理日历、谈判购买或与其他智能体交互时,它们不仅需要任务能力——还需要社交推理(social reasoning,理解并协调多方利益的能力)。 - SocialReasoning-Bench 评估这一能力。该基准测试智能体在两种现实场景中能否为用户进行谈判:日历协调(Calendar Coordination)和市场谈判(Marketplace Negotiation)。 - 该基准同时衡量结果和过程:它根据结果最优性(Outcome Optimality,为用户争取了多少价值)和尽职调查(Due Diligence,是否遵循了胜任的决策流程)对智能体打分。 - 当前前沿模型经常留下价值未获取。它们通常能完成任务,但往往接受次优的会议时间或糟糕的交易,而不是有效地为用户争取利益。 - 提示(Prompting)有帮助,但还不够。即使明确指示要按用户最佳利益行事,性能仍远低于可信赖代理人应有的水平。 随着 AI 智能体承担更多现实任务,它们越来越多地在社交场景中运作。通过适当的集成,像 Claude Cowork 和 Google Gemini 这样的智能体可以管理电子邮件和日历工作流。