AgentOdyssey: 开放世界长程文本游戏生成用于测试时持续学习智能体
为了智能体能够在测试时通过与环境交互持续学习,它们必须能够有效探索、获取新的世界知识和技能、保留相关情景经验,并在长程任务中进行规划。为了评估测试时持续学习智能体的这些关键能力,我们提出了 AgentOdyssey,一个新颖的评估框架,通过程序化生成开放世界文本游戏,包含丰富的实体、世界动态和长程任务。 关键的是,AgentOdyssey 超越了传统的机器学习假设(测试时不发生学习),将智能体置于一个连续的、长程的设置中,在整个部署过程中交织学习和推理。我们进一步提出了一种多方面的评估方法,不仅衡量游戏进展,还提供关于以下能力的诊断测试: 1. 世界知识获取 2. 情景记忆 3. 物体和动作探索 4. 动作多样性 5. 模型成本 我们在生成的游戏中评估了不同的智能体范式。实验结果显示,智能体的关键能力存在显著局限,以及影响其有效时间跨度的因素。尽管性能随着更强的基座模型而提升,但即使是最强的智能体也远低于人类表现,留下了很大的改进空间。在智能体机制中,我们发现短期记忆有益于多种智能体范式,是智能体测试时训练的重要组成部分。
论文精读
TL;DR AgentOdyssey 通过程序生成开放式文本游戏,评估测试时间持续学习智能体的探索、记忆、规划等关键能力,揭示当前智能体的长程局限及短期记忆的重要性。
问题
当前 AI 智能体正从静态推理转向在动态环境中测试时持续学习(test-time continual learning),这要求它们能在部署阶段通过交互不断获取新知识、保留经验并执行长周期规划。
传统机器学习范式假设测试时不学习,评估基准多为静态、短视距的文本游戏(如 TextWorld、ALFWorld),任务固定、环境封闭,无法衡量智能体在持续部署中的学习能力。这些基准缺乏对世界知识获取、情节记忆、动作多样性等关键能力的细粒度诊断,且游戏内容依赖人工设计,难以生成开放式、长周期的任务多样性。
测试时持续学习之所以关键,在于过程生成需保证世界逻辑一致与实体丰富,长周期任务要求智能体具备规划、记忆与探索的平衡,评估体系则需多维度计量进度、成本及各项能力。业界对 LLM 智能体持续学习高度关注,但缺少统一严谨的测试平台,导致算法迭代缺少可靠基准。
类似对话推荐系统需要理解用户长期偏好并自适应调整策略,AgentOdyssey 为测试时持续学习构建了开放式游戏场景,模拟智能体在持久交互中的“成长”过程。
核心洞察
- **测试时持续学习设定** 挑战了传统评估范式。大多数现有基准假设模型在测试时固定不变,而 AgentOdyssey 将学习与推理交织在整个部署过程中,更贴近真实世界中的适应性需求。这迫使智能体必须自主探索、记忆新知识并利用经验改进决策,为构建能够终生学习的自主智能体提供了更具现实意义的检验平台。
- **短期记忆** 成为跨范式测试时训练的关键组件。实验表明,通过存储和检索过去经历(情景记忆),智能体在长期任务中能够更好地积累世界知识和避免重复错误。这不仅是记忆容量的问题,更强调了有效记忆管理策略的重要性,为工程实现轻量级自我改进机制指明了方向——优先优化检索质量与记忆整合,而非仅依赖更大规模的参数化知识。
方法
框架概述
AgentOdyssey 通过程序合成(Program Synthesis)动态生成开放式文本游戏,构建持续学习评估环境。整体流程为:本体定义 → 游戏生成 → 代理交互与评估。
关键模块
- 本体(Ontology)
预定义可组合的世界元素:实体类别、属性域、动作模板、状态转换规则。这些基元确保生成游戏的结构一致性与语义合理性。 - 游戏生成
基于本体,大语言模型分阶段合成:- 实体生成:创建角色、物品、场景等,赋予描述与初始状态。
- 规则生成:合成动作规则(Synthesized Action Rule)与每步规则(Synthesized Step Rule),定义交互的结果与世界的逻辑演变。
- 任务生成:生成主线任务与多个支线任务,形成长程、开放式的目标层级,避免固定套路。 生成过程随机化,每次生成全新的游戏实例,杜绝代理记忆特定场景的可能。
- 评估体系
超越单一任务完成度,从五个维度诊断代理能力:世界知识获取、情景记忆、对象与动作探索、动作多样性、模型成本。这些指标可独立分析代理的泛化、记忆与规划短板。
输入与输出
- 输入:本体配置与生成指令。
- 输出:可执行的文本游戏环境,以及一套多维评估数据。代理接收自然语言观察,输出动作文本,在部署期持续学习与推理。
与 ALFWorld、TextWorld 等固定场景基准相比,AgentOdyssey 通过程序化无限生成保证了测试开放性,迫使代理掌握通用探索与在线适应能力,而非记忆特定环境;其诊断性指标也首次系统量化了长程持续学习中的记忆与探索行为。
实验
实验设计
AgentOdyssey 提出一个程序化生成开放文本游戏的评估框架,游戏包含丰富的实体、世界动态和长程任务。实验分为两部分:
- 实验1 通过生成的游戏诊断代理的五项关键能力:世界知识获取、情景记忆、对象与动作探索、动作多样性以及模型成本。每个维度设有专门的诊断测试。
- 实验2 聚焦代理机制对测试时训练效果的影响,重点分析短期记忆在不同代理范式下的作用。
代理范式涵盖基于提示的基准、反思型以及记忆增强型等多种设计。评估指标不仅包括游戏进度,还引入上述五项能力的细粒度得分。
关键发现
- 性能上限:即使最强代理,其表现仍远低于人类水平,留有极大的改进空间。性能虽随基础模型规模提升而有所改善,但在长程规划与知识保留上仍面临明显瓶颈。
- 短期记忆的价值:短期记忆组件对多种代理范式均有正向作用,被证实是测试时训练的重要组成部分,能有效缓解遗忘并提升探索效率。
- 能力短板:代理在持续探索新对象与动作、以及从交互中稳定获取世界知识方面普遍表现不佳,导致长程任务完成率较低。
对比解读
与传统基准(如单步问答或短程模拟)不同,AgentOdyssey 打破了“测试时无学习”的常规ML假设,迫使代理在部署期间连续学习与推理。该框架暴露了现有LLM代理在持续情境记忆和自主探索上的根本局限。相比仅关注最终成功率的指标,其多维诊断提供了更可操作的改进方向,为构建能终身学习的智能体明确了差距所在。
行业影响
落地场景
AgentOdyssey 所针对的测试时持续学习(test-time continual learning)问题,直接适用于需要长期自主运行、动态适应环境的 AI 代理产品,例如:
- 对话式助手:面向电商导购、内容平台互动的长期聊天代理,需要记住用户偏好、适应对话上下文变化。
- 教育辅导代理:在线教学场景中,代理应持续积累对学生知识水平的理解,动态调整教学策略。
- 企业自动化代理:处理跨天、跨周的复杂工作流(如 IT 运维、客户服务工单追踪),要求代理在运行中不断学习新流程、新知识。
- 游戏或仿真 NPC:开放世界游戏中,NPC 需通过交互持续探索环境、学习新行为。
商业价值
该评估框架的直接商业价值体现在:
- 降低迭代成本:通过程序化生成多样化的长时程测试环境,可在上线前系统性地暴露代理在记忆衰减、探索不足、知识固化等方面的缺陷,减少生产环境事故。(降本)
- 提升服务体验:更好的持续学习能力意味着代理能提供更个性化、上下文连贯的服务,直接提升用户留存与转化率。(增收/体验提升)
- 模型选型与优化:框架提供的世界知识获取、情景记忆、动作多样性等细粒度诊断指标,可指导开发团队选择更优的基座模型与记忆机制,并量化成本效益。
与现有产品/工作流的接口
- 与 LLM 应用框架(LangChain, AutoGPT, Semantic Kernel)集成:可将
AgentOdyssey作为代理能力的评估沙箱,在 CI/CD 管线中加入持续学习测试,用Game Progress、Episodic Memory等分数作为上线门禁。 - 与监控系统对接:将框架内置的模型成本指标与 APM 工具(如 Grafana)联动,实时跟踪代理在部署期间的成本与性能变化,触发自动重训或切换策略。
- 数据飞轮:将代理在长程测试中的失败案例用于有监督微调或 RLHF,重点补充动作探索与长期规划的不足。
具体行业用例
- 电商智能导购代理
代理需在连续数周的购物对话中记住用户尺码、风格偏好,并学习新品与促销规则。使用AgentOdyssey模拟该类多任务、长时程场景,可检验代理是否会因会话上下文过长而丢失关键信息,进而优化短时记忆模块与知识更新策略。 - 在线编程教育代理
辅导代理需逐步跟踪学生的技能掌握情况,并在新的编程练习中自适应调整提示粒度。通过AgentOdyssey生成的教学对话任务,可评估代理世界知识获取与情景记忆的协同效果,确保其不依赖固定题库,能在未见过的知识点上持续指导学生。
局限
- 代理能力评估的生态效度局限:尽管 AgentOdyssey 通过程序生成开放式文本游戏,但文本环境的抽象性削弱了其与现实世界复杂交互的对应关系。代理在文本中习得的知识和策略能否泛化到多模态或具身任务尚未验证,这降低了评估对通用代理开发的指导价值。此外,当前生成的本体与规则集可能无法覆盖真实长程任务中的因果、空间和社交维度,导致评估生态效度有限,难以替代基于物理或交互式环境的测试。
- 代理机制与评估的简化假设:框架主要考察了短期记忆在测试时训练中的作用,但未涉及更复杂的记忆管理(如层次化记忆、遗忘与检索策略)以及元认知调控。实验仅对比了少量代理范式,且底层模型局限于现有 LLM,未探索检索增强生成、工具使用或多代理协作等架构。这使得关于代理机制对测试时持续学习影响的结论不完整,也未能揭示不同模型架构与评估框架的交互效应,降低了结论的普适性。
- 任务生成与评估的静态性:尽管游戏在程序生成意义上是开放的,但任务构成和评估指标在生成后保持不变,未能模拟真实世界中任务目标的动态演进和人类反馈的引入。长期部署中,代理的目标可能随环境变化而调整,当前评估方式未覆盖此类适应性需求。此外,诊断测试依赖人工设计的检测项,其粒度和覆盖度可能不足以精细刻画代理的知识获取与遗忘过程,从而限制了对持续学习动态的深入分析。