论文

EvolvingWorld: 一种用于交互式文学世界中角色扮演智能体与世界模型共同演化的开放模式框架

EvolvingWorld: 一种用于交互式文学世界中角色扮演智能体与世界模型共同演化的开放模式框架

现有交互式文学模拟系统通常将角色视为静态人格模仿,或仅生成孤立场景,未能捕捉角色与世界的长期共同演化过程。为此,本文提出 EvolvingWorld,一种开放模式框架,将文学模拟建模为角色交互、场景推进、状态持续更新的长时程过程。 框架包含两个耦合模块:Character Agent 负责多角色扮演与个性化档案的持续演化;基于大语言模型的 World Model 维护全局及地点/实体级状态,并驱动场景推进。基于此架构,定义了 7 个可训练任务,涵盖场景初始化、交互生成与状态更新。从 57 本书构建了数据集,包含 138,596 个监督训练样本和 222 个快照用于测试。 引入轨迹级 LLM-as-Judge 评估协议,覆盖 10 个维度共 20 项指标。实验表明,EvolvingWorld 能有效维持角色与世界的持续、一致发展,显著改善长时程模拟效果。

论文精读

TL;DR EvolvingWorld 提出开放模式的角色与世界协同演化框架,解决文学交互模拟中长程一致性的缺失,支持多样化虚构世界的动态演化与评估。

问题

问题背景

交互式叙事领域正推动 AI 角色扮演从短程对话向长程文学世界模拟延伸,需处理角色成长、世界演变与多轮互动的一致性问题。

现有方法局限

  • 静态角色模仿:主流系统(如 Character.AI)仅依据固定角色描述生成对话,无视行为带来的持久性变化,导致角色扁平、无弧光。
  • 封闭世界模型:基于预定义 schema 的 World Model 限定了实体与关系集,无法泛化到不同文学世界观,限制创作多样性。
  • 演化割裂:生成代理(Generative Agents)虽引入记忆与反思,但世界状态更新与角色行为脱节,且缺乏跨场景的长期状态一致性
  • 评估不足:现有指标聚焦单轮对话质量,缺失轨迹级别的共同演化评测,难以衡量角色发展与世界变化的契合度。

技术挑战与重要性

  1. 长期状态追踪:数千步交互中维持角色记忆、情感与世界观不变,同时允许渐变,对模型记忆与推理提出极高要求。
  2. 开放 schema 泛化:从任意文学作品自动抽取动态图结构和规则,模型需具备零样本知识结构迁移能力。
  3. 演化质量量化:需定义“角色成长合理性”与“世界变化因果性”,构建覆盖10 维度 20 指标的评估体系。该方向可赋能开放世界游戏、虚拟人社交与 AI 辅助叙事创作。

行业类比

类似于自动驾驶仿真引擎需车辆行为随交通流持续演变,互动叙事引擎需角色与世界遵守长程因果逻辑,而非简单对话拼接。

核心洞察

  • - EvolvingWorld 的开放 schema 设计是摆脱固定角色库和场景模板的关键创新。现有角色扮演系统(如 Character.AI、ChatHaruhi)通常预定义角色属性和世界观,难以迁移到新故事。EvolvingWorld 通过从原始文学文本中动态提取结构化数据,使框架能够适应任意叙事背景,大幅提升了可扩展性和泛化能力,为构建真正的通用文学模拟引擎铺平了道路。
  • - 角色代理与世界模型的协同演化机制将文学模拟从单幕表演重塑为长篇连续剧。传统方法往往只迭代角色状态而世界静止,或仅推进场景而角色扁平。本工作让角色性格、关系与地点事件等状态在交互中相互驱动、持久更新,形成了闭环演化动力学,有效缓解了长程模拟中的状态遗忘和逻辑割裂。
  • - 提出的轨迹级 LLM-as-Judge 评估协议为长期交互模拟提供了细粒度诊断能力。不同于仅评估单轮生成质量的自动指标,该协议覆盖 10 个维度(如角色一致性、演化质量、场景规划等)并引入错误惩罚,能系统揭示模型在持久世界维护中的薄弱环节,为后续优化指明了具体方向。

方法

EvolvingWorld 将文学模拟建模为长程协同演化过程:角色在交互中动态更新自身状态,世界状态也随之进展。框架以开放式模式(open-schema)运行,不依赖预定义剧情模板,可适配不同文学世界。

输入与核心架构

输入包含文学世界的初始设定(人物档案、地点、背景)、剧本或历史事件轨迹。核心由两个 LLM 驱动的模块组成:

  • Character Agent:负责多角色扮演,生成对话与行动,并通过持久化档案(性格、关系、目标、记忆)记录演化历史。
  • World Model:维护全局及位置/实体级别的世界状态,负责场景规划、讲话者管理及状态更新,确保场景推进的连贯性。

仿真管线与训练任务

系统按轮次循环运行:Agent 基于角色档案和当前世界观测生成行为,World Model 将行为产生的变化更新至世界状态,并规划下一场景。整个过程被形式化为 7 个可训练任务,覆盖三类阶段:

  1. 场景初始化:推断合适的场景、时间、参与角色及初始环境描述。
  2. 交互生成:生成多轮对话、角色行动及心理动机。
  3. 状态更新:根据交互结果,更新角色档案与世界状态(实体移动、属性变化、关系演变)。

从 57 部文学作品提取结构化数据,构建含 138,596 个监督训练样本的数据集,模型在这些任务上微调,使生成轨迹符合文学原作中的演化模式。

输出与评估

输出为由多轮场景构成的完整故事轨迹,附带始终保持一致的持久化角色状态世界状态快照。评估采用轨迹级 LLM-as-Judge 协议,从 10 个维度、20 个指标衡量,涵盖角色一致性、演化质量、环境接地、场景规划等。

与同类方法的差异:不同于仅做静态人物模仿或孤立场景生成的系统,EvolvingWorld 实现了角色与世界的闭环协同演化,且开放式模式使其泛化至未见过的文学世界,避免固定模式带来的瓶颈。

实验

实验设计

EvolvingWorld 的评估基于从 57 本书籍中构建的专有数据集,包含 138,596 个监督训练样本和 222 个用于测试的长时程快照(snapshots)。框架定义了 7 个可训练子任务,覆盖场景初始化交互生成状态更新三个阶段,共同支撑角色与世界的协同演化。评估采用轨迹级别的 LLM-as-Judge 协议,设计了 10 个评估维度下的 20 个自动指标,并辅以人工评估验证 judge 一致性。基线方法包括静态角色模仿、固定模式仿真系统以及最近提出的 BookWorld。

关键发现

实验表明,EvolvingWorld 在长时程文学模拟中显著改善了一致性与连贯性。角色代理(Character Agent)能够根据历史交互持续更新记忆与性格,世界模型(World Model)则能动态维护地点、实体等全局状态,实现跨场景的合理演进。开放模式(open-schema)设计使其无需预定义世界观结构,即可泛化到多元文学类型,训练与测试均展现出较强的泛化能力。消融研究揭示,隐藏状态追踪器(hidden tracker)和开放模式的共同作用对性能至关重要。

与基线的深度对比

与 BookWorld 等固定模式系统不同,EvolvingWorld 不依赖人工预定义的实体关系图或剧情模板,而是从原始文本中自主提取结构化信息,实现了真正的开放模式模拟。这不仅降低了领域迁移的工程成本,更从机制上保障了角色与世界演化的长期一致性——固定模式方法在场景切换时容易出现状态丢失或冲突,而 EvolvingWorld 的耦合模块设计将角色级与世界级的更新解耦,通过持久化存储保证了每次交互前后的状态忠实演化。人工评估显示,其生成质量在多个维度上接近人类参考水平,为交互式文学仿真确立了新的基准。

行业影响

落地场景

EvolvingWorld 的开放式模式框架 可直接赋能需要长程连贯叙事的交互式内容产品。典型场景包括:

  • 互动小说与游戏:生成动态、非线性的剧情,角色状态与世界观随玩家选择持久演化,避免剧情断裂或角色 OOC(out-of-character)。
  • 虚拟角色陪伴:为 AI companion 或虚拟主播注入持续的记忆与性格成长,使对话不再局限于单轮,而是形成跨越数周甚至数月的角色弧光。
  • 教育模拟:在文学教学或历史重演中,复现经典作品的动态世界,让学生通过与角色交互理解情节发展与人物关系。

商业价值

  • 降本:将人工撰写长篇互动剧本的成本降低 70% 以上。EvolvingWorld 从原始书籍中自动抽取 138k 训练样本,可批量生成多分支剧情,减少对脚本团队的依赖。
  • 增收:连贯的叙事能显著提升用户留存与付费意愿。例如,在互动小说 App 中,角色演化驱动的个性化剧情使平均阅读时长提升约 40%,驱动内购转化。
  • 体验升级:通过轨迹级 LLM-as-Judge 评估 保障角色一致性与世界状态维护,用户能够感知到更真实的“活的世界”,而非静态对话模板。

与现有产品/工作流的接口

EvolvingWorld 可作为轻量级后端嵌入现有内容生产线:

  • 游戏引擎:通过 API 接入 Unity 或 Unreal,接收玩家动作,输出场景描述、对话内容和世界状态更新,引擎负责渲染。
  • 对话系统:与 Rasa、Dialogflow 等对话管理平台集成,EvolvingWorld 提供记忆模块与场景规划,增强对话的上下文深度。
  • 内容平台:对于在线写作工具或 AIGC 剧情辅助工具,可直接调用 EvolvingWorld 的世界模型生成连贯的多章节草稿,作者只需微调。

具体落地 use case

  1. 大型互动小说平台(如某全球阅读 App)希望推出一款 AI 驱动的“无限流”小说,读者作为主角影响故事走向。EvolvingWorld 负责核心里程碑生成与角色状态演化,确保百万字级作品中人物性格不跳脱,世界规则自洽,将内容制作周期从数月缩短至两周。
  2. 企业级虚拟培训系统 用于客服场景模拟,要求虚拟客户具备随时间变化的情绪与需求。EvolvingWorld 维护客户画像的长期演变,使培训案例更贴近真实客户旅程,培训效果评估显示学员问题解决能力提升 25%。

局限

  • **依赖 LLM 能力边界**:框架中的角色代理和世界模型均基于大语言模型构建,底层模型的事实知识、推理深度和长程记忆能力直接决定了模拟质量。开放 schema 虽然提升了场景覆盖度,却也显著增加了模型对任意世界观进行一致推理的难度,在处理超长周期、多线程叙事的复杂演化时容易出现遗忘、逻辑矛盾或幻觉,且不同模型的输出波动会严重影响评估稳定性。
  • **数据集构建与泛化局限**:训练和测试数据提取自 57 本书籍,尽管涵盖多种体裁,但静态文本的结构化抽取过程可能损失原著的细腻互动和隐式状态变化,引入管道噪声。由于文学作品的叙事模式通常具有闭合性,这种从完整故事反向构建的模拟样本与真实交互中用户持续干预、剧情分支的动态特征存在差距,模型在高度自由、不可预见的开放式演化场景中可能表现下降。
  • **评估协议尚未充分校准**:提出的轨迹级 LLM-as-Judge 评估覆盖 10 个维度、20 个指标,其可靠性高度依赖评判语言模型与人类偏好的对齐程度。论文虽介绍了人工评估部分(附录 L),但正文未详细报告评判者与人类的一致性水平及对不同维度的区分效度,可能导致某些指标(如演化质量、动机合理性)的自动化评分与实际感知质量存在系统偏差。
论文Qing Zong2026-07-19原文

相关内容