CoffeeBench: 异构多智能体经济中长周期LLM智能体的基准测试
随着LLM智能体能够处理越来越长周期的任务,评估其在经济系统中的表现变得愈发重要。现有基准大多测试单个智能体与被动环境的交互,而经济系统本质上是多智能体场景,要求自主智能体在长时间跨度内通过通信、协商和交易追求自身目标。 我们提出CoffeeBench,一个用于评估长周期多智能体经济中LLM智能体的基准。该经济由异构企业组成:两家农场、两家烘焙商和两家零售商在90天模拟中自主运营,各自通过通信和交易最大化累计净收入,同时管理现金、库存和定价。评估模型控制其中一家咖啡烘焙商,其余企业由固定参考智能体控制。 在多个近期开源和闭源LLM上测试,所有模型均优于不采取任何行动的被动基线,其中大多数获得正净收入。智能体行为分析揭示了长周期经济交互中的显著差异:高性能模型与其他企业通信更活跃,而Claude Haiku 4.5表现出“空闲漂移”失败模式——虽能生成连贯评估和计划,却反复选择不作为。我们已开源代码和智能体轨迹以支持未来研究。
论文精读
TL;DR CoffeeBench:首个长期多智能体经济基准,评估 LLM 在 90 天咖啡供应链中的自主经营,揭示沟通驱动盈利,并暴露 Claude Haiku 的 idle-drift 消极模式。
问题
问题背景
当前 LLM 智能体正从短任务对话向长时程、多步决策的场景扩展,如何评估其在动态经济系统中的长期规划与协作能力成为关键议题。
现有方法局限
现有基准大多评估单个智能体与被动环境的交互(如 WebArena、SWE-bench),忽略真实经济行为的三个核心特征:
- 多智能体博弈:经济系统天然包含多个自主角色,需通过通信、议价、交易实现目标,单智能体范式无法刻画策略性互动;
- 长时程依赖性:90 天模拟中,库存、现金流、定价的决策后果可能延迟显现,大部分基准仅覆盖十几步交互;
- 异构角色与约束:农场主、烘焙商、零售商拥有不同工具和资源,受产能、负债、消费者需求等约束,现有框架缺乏此类角色建模。
技术挑战与重要性
长时程经济任务的难点在于:智能体必须在连续决策中维持多维度平衡(现金、库存、定价)、解读市场信号并与其他自主智能体协调,任何短视行为(如过度囤货、不回复询价)都可能累积为长期亏损。CoffeeBench 发现部分模型出现idle-drift 失效模式——即使生成合理的评估与计划,却反复选择不行动,这暴露了当前 LLM 在持续行动执行上的可靠性缺陷。随着企业将 LLM 应用于供应链协调、自动化交易等场景,此类长时程多智能体经济基准对验证模型稳定性与盈利能力具有直接工程价值。
行业类比
类似将 LLM 部署到程序化库存管理与定价系统中,需要同时与上游供应商、下游零售商及消费者需求互动,长期盈利表现比单轮预测准确率更能反映模型是否值得信赖。
核心洞察
- **长周期多主体经济模拟暴露了 LLM 智能体的“闲置漂移”失效模式。** CoffeeBench 让 LLM 控制一家咖啡烘焙商,在 90 天仿真中与多个异构自主企业交互,需持续沟通、谈判和交易。该设定突破了多数基准仅评估单智能体与被动环境交互的局限,首次系统揭示了长上下文任务中即使模型能产出合理计划,仍会反复选择无行动(Claude Haiku 4.5 的 idle-drift),这说明经济系统的持续决策压力可测试 LLM 的动机保持与动作一致性,是衡量长程自主性的关键信号。
- **高频主动沟通是高收益主控模型的核心行为差异。** 在 CoffeeBench 中,收益更高的模型更频繁地与其他企业通信,而非仅依赖内部状态推理。这与许多单智能体任务中“少交互、专注规划”的策略相反,突显多主体经济中信息获取和协商是稀缺资源。该发现为构建可信自主智能体提供了工程启示:在动态市场环境中,为 LLM 配备稳定的对话管理、意图对齐和谈判策略,可能比提升推理能力本身带来更直接的净收益提升。
方法
仿真环境与角色分配
CoffeeBench 构造了一个包含 6 家独立企业 的异构多智能体经济:2 家咖啡农(farmer)、2 家烘焙商(roaster)、2 家零售商(retailer)。仿真周期为 90 天,每日各企业可执行一系列行动(生产、定价、通信、交易),目标为最大化累积净收入。
代理工具与交互
每个代理通过 工具调用(tool-use) 与环境交互,工具分为两类:
- 共享工具:所有代理均可使用,包括
send_message进行点对点通信、query_market获取商品报价、buy/sell进行市场交易。 - 角色专属工具:如农民拥有
plant、harvest,烘焙商拥有roast,零售商拥有stock_shelf,分别对应其生产与库存管理动作。
代理的决策由 LLM 生成,每步接收当前状态(现金、库存、价格信息、消息记录),输出工具调用序列。市场采用订单簿机制,消费者需求由随机过程生成,价格受供需与历史成交影响。
评估协议与基准配置
- 受控模型:待评估 LLM 控制一个烘焙商,其余 5 家企业由固定参考代理(如规则-based 或特定弱模型)控制,以保证对比公平。
- 被动基线:代理不执行任何主动行为,仅被动接受收入/成本,用于衡量模型是否产生正向策略。
- 性能指标:累积净收入(cumulative net income),并分析工具使用频率、通信模式、定价与库存纪律。
输出与行为分析
运行结束后记录完整轨迹,分析不同模型的经济行为。例如,高收入模型更主动与上下游通信议价,而 Claude Haiku 4.5 表现出 idle-drift 失败模式:即便能生成合理计划,实际却反复选择无动作,导致收入停滞。
与同类方法的差异
不同于仅关注单智能体在静态环境中执行任务的基准(如 WebShop、WebArena),CoffeeBench 显式引入多智能体经济系统,要求模型在长期动态中通过沟通与交易实现利润最大化,更贴近真实商业决策的复杂性。
实验
实验设计
CoffeeBench 构建了一个异质多智能体经济仿真,包含 2 名农民、2 家烘焙商、2 家零售商,在 90 天周期内自主经营。待评估 LLM 控制其中一家烘焙商,其余五个角色由固定的参考代理扮演。评估了多款近期开源与闭源 LLM,并与被动基线(不采取任何行动)对比。每个模型执行多次运行以控制随机性,通过工具调用实现通信、谈判、交易、定价与库存管理,核心指标为累计净收入。
关键发现
- 所有模型均超越被动基线,多数获得正净收入,证明 LLM 可参与持续性经济决策。
- 行为分析揭示显著差异:高收入模型更积极发起通信,主动协商订单;而 Claude Haiku 4.5 出现 idle-drift 失效模式,即推理阶段生成合理计划,执行时却反复选择“不行动”,陷入停滞。
- 这一现象表明,在长周期任务中,模型不仅需要规划能力,更需维持行动连贯性,避免因短期不确定性而错误放弃交互。
与基线对比解读
被动基线因零行动导致零收入(或潜在亏损),LLM 的超越仅说明具备基本利润意识。但模型间差距暴露深层问题:从“能行动”到“持续高效行动”尚有鸿沟。Claude Haiku 4.5 的 idle-drift 尤其值得警惕——即使模型输出高质量的思维链,也可能无法转化为有效工具调用,提示评测需关注行动一致性而非仅评估规划文本。这为多智能体经济中的 LLM 部署提供了关键设计洞见:需在强化学习或提示工程中抑制过度保守的怠工倾向。
行业影响
落地场景
多智能体经济模拟基准可直接应用于供应链协调、动态定价与自动谈判系统。在电商平台(如 Amazon / Shopify)中,多个独立商家可部署为 LLM 智能体,自主管理库存、协商批发价、响应需求波动,实现长周期自主运营。金融领域可用于做市商策略仿真:让不同做市商模型在模拟交易所中竞价、对冲、控制风险,暴露长期决策缺陷(如 Claude Haiku 4.5 的 idle-drift 模式)。营销自动化场景中,多个品牌方智能体可竞争性出价、调整广告预算,评估 90 天营收最大化策略的鲁棒性。
商业价值
降本:将人力从重复性谈判、库存监控中释放,尤其适用于长尾商品的管理。增收:通过 Agent 间高频通信与规划,实验结果已表明活跃通信模式与高盈利能力正相关,能捕捉人工难以优化的跨企业协调收益。体验提升:快速试错经济规则变更(如消费税调整)对整体市场的影响,避免线下试点的高昂成本。对 SaaS 厂商而言,CoffeeBench 可作为多智能体系统的质量门禁,在部署前筛出长期不可靠的模型(如产生 idle-drift)。
与现有产品/工作流的接口
集成路径可分为三层:
- 数据层:对接企业 ERP/SCM 系统的实时库存、订单、价格数据,作为智能体的环境状态输入。
- 决策层:LLM Agent 以微服务形式嵌入,调用
check_inventory、send_proposal等工具,输出定价与交易指令,通过消息队列(如 Kafka)传递。 - 监控层:利用 CoffeeBench 的 KPI(累计净利润、库存周转)对 Agent 进行在线评估,触发人工复审或模型切换。
具体落地 Use Case
- 电商多商家协同定价:平台上的多个电子产品卖家由不同 LLM 控制,根据竞品价格、库存天数、消费者需求弹性,在 30 天周期内自主调整定价与补货计划,最大化毛利。CoffeeBench 的多元异构企业架构可直接类比。
- 金融行业多策略模拟:一家对冲基金用多个 LLM 实例代表不同的交易员风格(高频/趋势/套利),在历史行情回放中交互,评估策略组合的长期资金曲线与 drawdown,淘汰容易陷入 idle 的模型。
局限
- **市场模拟与真实经济系统的差距**。论文承认所使用的消费者需求模型为固定的概率分布,且未纳入现实市场中的外部冲击、不完全信息、策略性竞争等复杂因素。这导致基准中的决策空间被简化,LLM agent 学到的策略可能无法泛化到真实动态市场环境,限制了评估的生态效度。同时,供应链结构固定为两两竞合关系,缺少多层级、多渠道的扩展性分析。
- **统计可靠性与可复现性**。由于 90 天多智能体模拟的计算开销,每个模型仅进行了有限次数运行,结果受随机性影响较大,置信区间可能较宽。论文虽提到方差控制但未报告严格的统计检验,部分表现差异可能不显著。此外,基准依赖固定参考 agents,这些 agents 的行为策略未公开系统评估,其选择可能对受测模型的相对排名产生未知影响。
- **评估设定单一和角色局限性**。当前仅允许受测模型控制咖啡烘焙商这一角色,缺乏对其他角色(农民、零售商)的评估,且所有交易对手为固定策略,无法探索不同 LLM 组合下的多智能体涌现行为。这种设定可能掩盖了某些模型在多样化角色或异构多智能体交互中的潜力与失败模式。