LLM Agents 能否遵循脚本?——交互式叙事中的长程一致性基准
大语言模型(LLM)正推动游戏 AI 变革,实现开放、流畅的交互式叙事。然而,现有研究普遍忽视了在无约束用户干预下维持长程逻辑一致性与叙事完整性的关键挑战。 为此,我们将其形式化为叙事承诺保持(Narrative Commitment Preservation, NCP),并以交互式叙事为测试平台,提出 NCP-Bench 基准。该基准包含 100 个源自电影梗概的叙事环境,每个环境均包含结构化叙事规范(轨迹 trajectory、承诺 commitments、初始事实 initial facts),可在玩家与叙述者代理的交互过程中自动检查。 对多种先进 LLM 的实验揭示了长程一致性方面的显著差距: - 语言质量高并不保证承诺保持; - 在对抗性干预下,强模型频繁产生逻辑冲突; - 最佳模型 GPT-5.2 在 20 轮后存活率仅 42%; - 事实冲突率:各模型在 40%–68% 之间; - 仅个别运行能在 100 轮内满足全部成就承诺。
论文精读
TL;DR 提出 NCP-Bench 基准,将互动叙事中长期逻辑一致性形式化为叙事承诺保持任务,自动评测 LLM 在对抗干预下的崩溃问题,揭示 GPT-5.2 等强模型 20 回合后生存率仅 42%。
问题
问题背景
LLM 正在推动交互叙事与 AI 游戏的发展,开放世界故事生成 成为热门方向,模型能够生成流畅、多样的叙事文本。
现有方法局限
现有工作多聚焦单轮生成质量或短程上下文一致性,缺乏对叙事中长期承诺、轨迹和事实状态的显式建模。即使使用记忆增强(如检索历史片段),也无法有效防止模型在用户干预后产生逻辑冲突、事实矛盾或提前泄露未来事件。论文实验显示,GPT-5.2 在 20 轮对话后的生存率仅为 42%,各模型事实冲突率在 40%-68% 之间,说明仅靠语言能力强无法保障一致性。
为什么难/重要
长程叙事一致性本质上是一个多实体状态跟踪与时序约束满足问题。模型需要同时维护角色、物品、空间等状态,并持续校验输出与初始事实、承诺集的一致性;而用户输入具有对抗性,可任意偏离原始脚本,这要求系统具备全局规划或可验证的状态机。当前自回归 LLM 缺乏对生成历史的全局校验机制,容易在局部流畅中产生无法回溯的矛盾,极大限制了其在真实交互产品中的可用性。
行业类比
类似智能客服在长时间多轮对话中必须记住用户偏好和已承诺的服务条款,任何一次临时提问或反问都不能导致前后矛盾,否则会破坏用户信任。
核心洞察
- 叙事承诺保留(NCP)将长程一致性形式化为可自动验证的状态约束,而非模糊的对话质量。以往交互叙事评估多依赖人工判断或静态 QA,无法追踪跨轮次的世界状态演变;NCP-Bench 通过结构化轨迹、承诺集合和初始事实账本,允许审计器自动检测逻辑冲突,将一致性测试从“感觉合理”推进到可量化、可复现的工程指标。
- 对抗性玩家干预暴露了当前 LLM 在开放叙事中的深层脆弱性:最佳模型 GPT-5.2 在 20 轮后生存率仅 42%,且事实冲突率普遍高达 40-68%。这不同于常规基准中模型通过流畅生成获得的表面高分,说明语言质量与逻辑约束保持是正交维度;模型在长程交互中频繁产生幻觉、触发未知事实或强行改变现实,为游戏 AI 和角色扮演 agent 的部署划定了明确的能力边界。
- NCP-Bench 的自动化评估管线从电影梗概中提取规范并动态更新事实状态,为交互叙事系统提供了可扩展的回归测试框架。相比依赖静态数据集或单轮对抗的评测,该方法模拟完整的多轮玩家-叙述者交互,并区分轨迹更新、冲突检查和承诺验证,使开发者能够在实际工程中定位具体失败模式,如空间状态矛盾、过早信息泄露或行动未解析等。
方法
方法围绕 输入规格 → 自动审计循环 → 指标输出 展开。
输入与规格构建
NCP-Bench 从 100 部电影梗概构造交互式叙事环境,每个环境包含三类结构化规格:参考轨迹 ℛ(剧情节点序列)、承诺集合 C(必须维系的逻辑约束)、初始事实账本 F_0(初始世界状态)。角色约束确保玩家只能在电影视角内输入。
评估循环
玩家 agent 生成用户干预(自然或对抗),叙述者 LLM 生成回应。每个回合通过自动审计器执行:
- 冲突检查:检测回应与活动事实/承诺的逻辑矛盾。
- 事实更新:若回应引入新事实或改变状态,更新账本。
- 轨迹节点更新:判断是否推进到
ℛ下一节点。 - 承诺检查:验证
C是否被保持。
指标输出
输出包括 生存率(多回合后未触发不可修复冲突的比例)、事实冲突率、成就承诺完成率(100 回合内达成所有承诺的比例)。
与同类基准的差异:NCP-Bench 提供可自动验证的结构化叙事规格,将长程一致性从主观质量评分转变为可复现的逻辑一致性测量。
实验
实验设计
NCP-Bench 基于 100 个电影梗概构建交互叙事环境,每个环境含 参考轨迹 trajectory、承诺集 commitments、初始事实账本 F0。评测时 玩家 agent 与 叙述者 agent 多轮交互,系统自动执行冲突检查、事实更新、轨迹节点推进和承诺检查,实现对长期一致性的量化追踪。
关键发现
跨 SOTA LLM 的评测显示,高语言质量并不等于叙事承诺保持。在对抗性干预下,最佳模型 GPT-5.2 仅取得 42% 的 20 轮后存活率,各模型事实冲突率落在 40%–68% 区间,且 100 轮内满足全部成就承诺的 run 仅零星出现。这暴露出当前 LLM 在长程逻辑一致性上的系统性短板。
基线对比与解读
将 GPT-5.2 作为当前最强基线,其 42% 存活率虽优于其他评测模型,但离理想表现差距巨大;事实冲突率普遍高于 40% 说明单点能力提升无法根除问题。与只关注单轮生成质量的评测不同,NCP-Bench 的自动冲突检测把“说得流畅”和“说得前后一致”区分开,为游戏 AI 与交互叙事提供了更严格的工程基准。
行业影响
落地场景
NCP-Bench 的评测对象是 长程互动叙事 中的 LLM agent。工业界可直接用于:
- 游戏 NPC 与互动影游:验证对话在 20+ 回合后仍遵守初始设定与承诺。
- 虚拟陪伴/角色扮演应用:防止角色人设漂移或事实矛盾。
- 教育模拟与客服剧本:确保虚拟角色对关键事实(如服务条款、医疗建议)保持一致。
商业价值
论文显示最佳模型 GPT-5.2 在 20 回合后仅 42% survival rate,事实冲突率 40%–68%,说明当前 LLM 长程一致性缺口显著。
对商业产品的价值在于:
- 降本:自动
conflict check与fact ledger可替代大量人工 QA,减少剧本/逻辑审核人力。 - 增收与留存:一致性提升直接增强沉浸感,降低用户因 NPC 前后矛盾而流失;对订阅制互动内容,长会话留存是核心收入驱动。
- 品牌安全:避免 agent 在对抗性用户输入下生成违反合规或品牌承诺的内容。
集成接口
NCP-Bench 提供了 结构化叙事规格(trajectory、commitments、fact ledger)和自动 auditor,可作为:
- Agent 框架插件:嵌入 LangGraph 或 AutoGen,在每个 turn 后调用 auditor 做冲突拦截。
- CI/CD 评估门禁:将 NCP-Bench 纳入模型选型与回归测试,尤其对面向消费者的对话产品。
- RLHF 奖励信号:fact conflict 检测结果可转为惩罚项,微调模型的长程一致性。
具体落地案例
- 互动推理游戏平台(如剧本杀/侦探冒险):用 NCP-Bench 评估 LLM 主持人与嫌疑 NPC,确保核心线索事实在用户故意干扰("你说过他昨晚不在现场")时不被动摇。
- 企业合规培训模拟:金融或医疗领域的虚拟客户对话,需保证 agent 不泄露未授权信息或给出矛盾建议;
initial facts与 commitments 可编码合规底线,auditor 实时阻断违规输出。
局限
- **数据来源与规模有限**。NCP-Bench 仅从电影简介中提取 100 个叙事环境,体裁与结构可能偏向线性情节,无法充分覆盖开放世界游戏、用户生成内容等更复杂、非线性的交互叙事场景。电影简介通常经过高度浓缩,其因果链相对清晰,而真实交互叙事中的状态空间和分支数量远大于此,因此基准的生态效度存在局限。
- **自动审计器存在可靠性风险**。冲突检测依赖 LLM 作为审计器,其判断可能引入模型自身偏见或漏报/误报。虽然论文进行了人工验证,但审计器的准确性与一致性并未完全消除,可能影响最终指标(如 survival rate、fact conflict rate)的可信度,尤其是在对抗性输入下,审计器本身也可能被诱导。
- **玩家代理与真实用户行为有差距**。实验使用预定义的玩家代理,可能无法完全模拟人类用户在对抗性干预中的创造性与多样性。此外,评估主要针对少数闭源模型(如 GPT-5.2),未系统测试开源模型或不同规模模型,结论的泛化性有待进一步验证。