FM-Bench: 智能体长期管理决策的基准测试
语言模型智能体在受限任务上已表现可靠,但其能否在长期决策中保持有效——即行动具有累积后果、环境随选择动态响应——仍缺乏系统度量。FM-Bench(Football Management Benchmark)正是为此设计:一个LLM智能体需通过26个工具、约340至400个决策节点,管理一家足球俱乐部长达20个游戏年。它要在与对手相同的预算下组建阵容、交易球员、谈判合同、投资设施与青训、设定战术,并面对可能解雇它的董事会。整个评估由确定性引擎逐年累积为唯一最终得分,无需LLM裁判或人工评分。 实验包含两条赛道:solo track让15个前沿模型分别面对一个冻结的脚本世界;Arena则将模型与一个脚本锚点置于同一20年世界,实现首次大规模头对头评估。结果发现,全部15个模型都能跑完整个长期任务,而盲脚本基线大多中途崩溃。claude-fable-5在平均分与Arena中均居榜首,但冠军在不同种子下仍会在多达十个模型间轮换。模型规模、价格或供应商均无法预测排名;排名在后期才逐渐定型,且人类最佳开局也只能垫底。 进一步分析表明,拉开差距的是管理行为而非计算量:高得分模型在末期减少慢回报投资,保持资金运转而非闲置,并提前开启续约谈判;而token消耗与表现无关。同时,模型均未能从数百次被拒报价中学会市场隐藏价格;自管理记忆也出现两种失败模式——持续增长的档案或每季重写的计划。代码已公开:https://github.com/Analogy-AI/fm-bench。
论文精读
TL;DR FM-Bench 让 LLM 智能体管理足球俱乐部 20 年,用确定性引擎和双模式评估衡量长期决策能力,揭示管理行为而非模型规模或 token 消耗才是性能关键。
问题
问题背景:LLM agents 已能可靠完成有限步任务,但长周期自主决策(如连续多年管理、累积后果)仍缺乏系统评测。
现有方法局限:主流基准多面向短视界、单一回合或独立任务;部分长程评测依赖 LLM judge 或人类评分,引入主观噪声与不可复现性;且环境通常不回传累积状态反馈,无法考察“今天的决策如何影响十年后”;多智能体场景常缺少共享世界与并行 head-to-head 对比,难以分离模型策略与脚本对手的差异。
为什么这个问题难/重要:长周期问题需要模型在 340-400 个决策点间持续分配预算、处理隐藏市场信息、延迟账单和董事会压力,信用分配极稀疏,环境状态随策略演化而非平稳;同时必须与对手共享同一经济与阵容动态。业界正从对话框转向自主 agent 部署,可复现、无 LLM judge 的 deterministic 基准是评估代理长期可靠性的关键缺口。FM-Bench 通过 20 个游戏年、26 工具、15 模型单机与共享世界 Arena,首次在此规模提供 head-to-head 证据:模型排名直到后期才稳定,且行为指标比 token 消耗更能解释分数。
行业类比:这类似于用连续的 10 万公里无接管实测替代短场景测试来评估自动驾驶系统——只有长时累积后果才能暴露短序列中不可见的策略漂移。
核心洞察
- FM-Bench 首次在20年游戏内时长、数百个决策点的规模上,用确定性引擎而非 LLM judge 评估多智能体长期管理,填补了从有限任务到持续决策的评测空白。它与现有长周期评测(如 WebArena、GAIA 等多用 LLM judge 或人类评分)不同,通过完全确定性的环境消除了评审噪声,使结果可复现且能归因于模型行为。这种设计让“排名只在后期稳定”等结论可信,并允许分解六个行为能力。
- 论文发现模型排名与规模、价格、token 花费无关,而与管理行为(如是否减少末期慢回报投资、保持现金投资、提前续约)强相关,挑战了“更大模型或更多推理预算等于更好长期决策”的直觉。与传统基准常报告模型能力与规模正相关不同,FM-Bench 显示在累积后果和资源约束下,策略选择比原始计算更重要,对实际工程中如何为长周期任务配置和微调模型有直接启示。
- 自管理记忆在长周期任务中出现两种系统性失败——要么无限增长档案导致检索失效,要么每季重写计划丢失历史,这一发现暴露了当前 LLM agent 架构在长期记忆管理上的根本缺陷。它与现有工作多关注短期上下文或外部检索增强不同,通过真实20年模拟揭示:没有结构化记忆更新机制,模型无法从历史经验中学习,如未能从数百次被拒出价中推断隐藏价格。这提示工程上需要设计专门的记忆模块或采用外部数据库管理长周期状态。
方法
输入
FM-Bench 提供一个足球管理模拟环境,LLM agent 通过自然语言指令了解任务规则与工具接口,在 20 个游戏年内持续决策。每个决策停止点(decision stop)模型可自由选择工具调用次数,整个周期包含约 340-400 个决策停止点、26 个可用工具。
关键模块
- 确定性模拟引擎:负责所有俱乐部运营,包括选秀(固定预算)、球员交易、合同谈判、设施与青训投资、阵容设置及董事会解雇判定。引擎行为完全确定,杜绝随机干扰。
- 对手脚本:solo track 中对手行为由冻结脚本控制;Arena 模式则将多个模型与一个脚本锚点放入同一共享世界,实现 head-to-head 竞争。
- 记忆系统:提供两种自管理记忆模式——archive(只追加不清理)与 plan(每赛季重写计划),用于考察模型长程记忆维护能力。
- 评分模块:无 LLM judge 或人工评分,确定性引擎累积 20 年数据生成最终得分,并分解为六项行为能力指标(如延迟收益投资、现金利用率、续约时机把握、市场价格学习等)。
输出
模型在 solo track 的排名、Arena 共享世界的冠军竞争结果,以及行为分析报告。实验覆盖 15 个前沿模型、三个随机种子,所有模型均完成全部时域,而脚本基线多数死亡。
FM-Bench 与同类长期决策基准的核心差异在于:首次在 20 年时域和 head-to-head 规模下使用纯确定性评分,不依赖任何 LLM 评判或人工标注,直接测量管理行为本身而非 token 消耗或模型规模。
实验
实验设计
FM-Bench 用 确定性引擎 模拟足球俱乐部 20 个赛季,每个模型通过 26 个工具、340–400 个决策点管理球队;分 solo track(15 个前沿模型 vs 冻结构建世界)和 Arena(共享同一世界 + 脚本锚点)。三个随机种子,均有完整轨迹。
关键发现
- 所有 15 个模型在 solo track 中完成全部 horizon;盲脚本基线多数死亡。
- claude-fable-5 在 solo 平均分和 Arena 均居首,但 Arena 冠军在 10 个模型间轮换。
- 性能与规模、价格、token 消耗无关;行为特征才是区分因素——高分模型在末期减少慢回报投资、保持现金投入、提前开启续约。
与基线对比解读
脚本基线包括 Heuristic(纪律管理者)、Idle(下限)和 Random(低于下限),它们在长 horizon 中因缺乏适应能力而死亡。模型虽然全部存活,但未能从数百次被拒报价中学习市场隐藏价格;自管理记忆失败有两种模式:只增档案或每年重写计划。这揭示当前 LLM agent 在长期信用分配和在线学习上仍有明显短板,与 FM-Bench 强调的 cumulative consequences 直接相关。
行业影响
落地场景
FM-Bench 所评估的长期决策能力可迁移至多个需要多步代理、累积后果的真实业务:
- 供应链与库存优化:让 LLM 智能体在 20 个季度(类比赛季)内管理多 SKU 的采购、仓储与定价,应对需求波动和竞争响应。
- 金融投资组合管理:模拟多年期资产配置,由智能体决定买卖、再平衡及风险预算,累积收益作为最终评分。
- 企业资源规划:长期预算分配、设施投资与人才梯队建设,类似俱乐部管理中的设施与青训投入。
这些场景的共同点是行动产生延迟反馈、资源有限且环境会响应决策,与 FM-Bench 的设计高度一致。
商业价值
- 降低长期决策失误成本:通过 benchmark 筛选出擅长跨期权衡的模型,避免在真实业务中因短视(如论文中观察到的“减少末期慢回报投资”)造成损失。
- 减少 token 开销:论文发现 token 花费与性能无关,意味着企业可选择更小但行为更合理的模型,直接降低成本。
- 加速模型迭代:确定性引擎和固定工具集使评估快速、可重复,团队可在上线前量化比较不同基座模型或微调变体的长期表现。
与现有产品/工作流的接口
FM-Bench 提供确定性 Python 环境、26 个工具和固定决策日历,可直接集成到 MLOps 流水线:
- 模型选择阶段:在 CI 中运行 solo track,作为长期决策能力的回归测试,与短程 benchmark 互补。
- 强化学习训练:该环境可作为 reward 来自引擎的模拟器,用于微调模型的行为(如“保持现金投资”、“提前续约”)。
- 多智能体研究:Arena 模式支持共享世界竞争,可扩展为企业内部多个 AI 决策模块(如不同业务线代理)的对抗测试沙盒。
具体落地 use case:
- 电商动态定价与库存:智能体管理一个商品品类 20 个月,每周决定补货量和价格,引擎根据销量、竞品价格、库存成本累计利润。可用 FM-Bench 的“replay gate”和“cash utilization”等行为指标监控长期表现。
- 内容平台创作者经济:智能体担任虚拟 MCN,为签约创作者分配资源、谈判合同、投资制作,以 10 年总收益为目标,评估长线运营能力。
局限
- **领域泛化有限**:基准场景仅限足球俱乐部管理,虽然工具丰富、决策链长、时间跨度大,但任务域相对狭窄。从工程角度看,金融投资、供应链调度、城市管理等长程决策场景在目标函数、约束类型和反馈延迟模式上差异显著。论文结论(如管理行为优于模型规模、token 消耗不预测性能)是否具备跨域迁移性仍需验证。与更通用的智能体基准(如 WebArena、AgentBench 的多样性任务)相比,FM-Bench 的专业性限制了其作为通用长期决策评估工具的适用度。
- **记忆机制设计单一**:论文中 self-managed memory 仅提供“只增档案”和“每季重写计划”两种模式,且均出现失败。但实际的长期智能体需要更复杂的记忆管理,如分级存储、检索增强、向量数据库或插件式记忆模块。实验未探索这些机制,可能低估了模型在更好记忆架构下的长期规划能力,也使“自管理记忆失败”的结论可能只是设计限制所致,而非模型固有缺陷。
- **环境确定性限制**:使用 deterministic engine 保证了可复现性,但也消除了现实世界中的随机性和不确定性(如球员伤病、市场突发波动、外部经济冲击)。模型可能在固定规则下过拟合到某些策略,而真实管理决策需要应对噪声和未知扰动。与真实世界模拟器(如经济学模拟、博弈论环境)相比,确定性降低了生态效度,可能高估模型在动态、随机环境中的鲁棒性。