论文

迈向忠实模拟人类购物行为

迈向忠实模拟人类购物行为

在电商场景中,模拟真实的用户购物行为对于离线评估与强化学习至关重要。尽管基于 LLM 与 VLM 的模拟器已取得进展,但复现真实浏览会话仍面临两大挑战:(i) 记忆挑战:一次购物会话跨越数十个页面,现有智能体要么丢弃长期观测历史,导致用户状态丢失;要么简单拼接,使上下文窗口过载,甚至降低模拟质量。(ii) 优化挑战:现有用户模拟器通常以模仿或逐步奖励的方式匹配每个记录的动作,导致生成的会话常出现不真实模式(如过度探索或过度被动),而逐步监督无法发现或纠正。 为解决上述挑战,我们提出 RecVerse——一种 GUI 接地的模拟智能体,通过截图感知页面并生成忠实的多轮轨迹。针对记忆挑战,RecVerse 采用认知启发的层次记忆:Working Memory 负责短期焦点,Episodic Memory 记录会话内轨迹,Preference Memory 保存高层意图,并将记忆更新视为动作,使智能体自适应地决定记忆内容与时机。针对优化挑战,RecVerse 使用轨迹级强化学习目标对整个会话打分,在宏观动作类型分布与微观购物意图两方面对齐真实用户。 我们还发布了 USB(User Simulation Benchmark),一个交互式电商 GUI 轨迹数据集,用于多轮用户模拟。实验表明,RecVerse 在行为保真度与意图一致性上显著优于现有基线。

论文精读

TL;DR RecVerse 用认知启发的分层记忆与轨迹级强化学习,让 GUI 智能体模拟真实多轮购物会话,解决长程记忆丢失与步级监督导致的失真,并发布 USB 基准。

问题

问题背景:电商场景中的离线评估与强化学习依赖高保真用户行为模拟器,用于策略迭代和推荐系统验证。近期 LLM 和 VLM 基模拟器虽取得进展,但复现真实购物会话仍有明显差距。

现有方法局限:

  • 记忆挑战:一个购物会话通常包含几十个页面,现有代理要么丢弃长程观察历史,丢失用户状态演化;要么简单拼接所有历史,超出上下文窗口,反而降低模拟质量。
  • 优化挑战:现有模拟器大多通过模仿学习或步骤级奖励监督每个日志动作,生成会话常出现过度探索或过度被动等不真实模式,逐步监督无法检测或纠正这些分布级偏差。

为什么这个问题难且重要:长程依赖建模本身是序列决策难题,用户意图会随浏览动态变化;同时,轨迹级分布对齐要求模型理解整体行为模式,而非逐动作克隆。若模拟器失真,下游离线评估会高估或低估策略效果,导致线上部署风险增加。

行业类比:类似于自动驾驶仿真中,仅匹配单帧驾驶动作无法生成安全轨迹,必须模拟完整行程的意图与交互分布;电商用户模拟也需要从“动作级克隆”转向“会话级仿真”。

核心洞察

  • RecVerse 的核心创新在于将记忆管理建模为可学习动作,采用认知启发的三层记忆结构(工作记忆、情景记忆、偏好记忆)动态维护会话状态。与现有模拟器要么丢弃长历史、要么无脑拼接导致上下文爆炸不同,该设计让代理自主决定何时写入、读哪一层记忆,在保留长期购物意图的同时控制 token 消耗,更贴近人类在多页浏览中的注意与记忆切换机制。
  • RecVerse 用轨迹级强化学习奖励替代逐步动作模仿,同时对齐宏观动作类型分布与微观购物意图。逐步监督只能匹配单步日志动作,无法检测 over-exploration 或过度被动等会话级失真;轨迹级奖励从整条会话评分,促使代理学习真实用户的浏览节奏和意图连贯性,这是对用户模拟优化目标的关键升级。

方法

输入

RecVerse 接收 GUI 截图 作为当前页面观察,并结合历史交互上下文。长会话中的原始历史不直接拼接,而是通过分层记忆系统压缩与组织。

关键模块

  1. 认知启发式分层记忆

    • Working Memory:保存最近几步的页面截图与动作,捕获短期上下文。
    • Episodic Memory:存储会话中关键事件与轨迹摘要,解决长程依赖。
    • Preference Memory:维护高层购物意图与用户偏好,驱动全局决策。
    • 记忆更新本身被建模为代理可执行的动作:代理通过 RL 学习何时写记忆、写什么内容,避免全量拼接导致上下文过载或丢弃关键信息。
  2. 轨迹级 RL 奖励塑形

    • 优化目标从逐步模仿或步骤级奖励转向对整个会话轨迹评分。
    • 宏观奖励:对齐动作类型分布(如浏览、点击、加购、购买比例)。
    • 微观奖励:对齐具体购物意图(如点击商品与用户兴趣类别的一致性)。
    • 格式奖励:保证输出动作符合 GUI 操作格式。
    • 使用强化学习(如策略梯度)最大化整条轨迹的累积奖励。

输出

代理输出多轮 GUI 操作序列(点击、滚动、翻页、购买等),生成忠实于真实用户的购物轨迹。

与同类方法的差异:RecVerse 同时用分层记忆管理长会话状态,并用轨迹级 RL 对齐全局行为分布,而非仅依赖逐步模仿或固定窗口记忆。

实验

实验设计

论文基于新发布的 USB (User Simulation Benchmark) 交互式电商 GUI 轨迹数据集评测 RecVerse。基线覆盖两类:

  • Text-based 方法:使用纯文本页面描述的模拟器
  • GUI-based 方法:基于截图的视觉语言模型模拟器

评测指标分为两组:

  1. Behavioral Fidelity Metrics:衡量会话级行为分布与真实用户的一致性,包括动作类型分布、探索深度、会话长度等
  2. Intent Consistency Metrics:衡量购物意图在 item-level 和 category-level 与 logged session 的匹配度

实验还包含消融研究(记忆模块各组件、奖励函数各分项)、人类评估、奖励敏感性与 scaling 分析。

关键发现

RecVerse 在行为保真度和意图一致性上均显著优于现有基线。消融实验表明:

  • 直接拼接长历史会因上下文窗口过载而 降低 模拟质量
  • 丢弃历史则丢失演化的用户状态,导致动作分布偏离
  • 层次化记忆(Working Memory / Episodic Memory / Preference Memory)与 trajectory-level RL 的组合是关键

宏-微观双层奖励有效抑制了过度探索和过度被动两种失真模式,使生成轨迹在宏观动作类型分布和微观购物意图上同时对齐真实用户。

与基线对比解读

与 step-level imitation 的基线相比,RecVerse 的核心优势在于轨迹级优化:单步监督无法捕获会话级的分布偏差,而 trajectory-level RL 直接优化整段会话的全局得分,因此能校正长程行为模式。记忆模块则解决了长会话中信息保留与上下文窗口的矛盾:相比 naive concatenation 带来的噪声干扰,层次化记忆通过将“何时记忆、记忆什么”作为可学习动作,实现了自适应、有选择的记忆更新。这一设计更接近人类购物时的认知过程,也解释了其在不同尺度 scaling 下的鲁棒表现。

行业影响

落地场景

RecVerse 适用于 电商平台 的推荐 / 搜索 / 广告系统的离线评估与强化学习训练。具体用例:

  • 推荐系统仿真:用合成多轮会话替代部分在线 A/B 测试,评估排序策略在浏览-点击-加购-购买全链路的表现。
  • GUI 交互测试:模拟用户在商品详情页、购物车、结算页的浏览与操作,测试前端交互与个性化 UI 的合理性。

商业价值

  • 降低实验成本:高保真用户仿真可减少对真实流量的依赖,尤其在新策略冷启动或高风险变更时,显著降低试错成本。
  • 提升模型质量:用轨迹级 RL 生成的会话数据训练推荐 / 搜索模型,能改善长期回报与用户意图一致性,进而提高转化率与 GMV。

与现有产品 / 工作流的接口

RecVerse 以 GUI 截图 为输入、输出动作,可作为独立 仿真环境 接入现有 MLOps 管道:

  1. 替换或增强传统 点击模型 / 规则引擎,为排序模型提供更真实的交互反馈。
  2. 作为 离线 RL 环境 输出 (observation, action, reward) 三元组,直接对接现有 RL 训练框架(如 Ray RLLib、OpenAI Gym)。
  3. 生成的数据可导出为日志格式,与现有特征平台、特征工程工具链兼容,用于训练 CTR/CVR 预估模型。

局限

  • 环境依赖与泛化性受限。RecVerse 的感知基于 GUI 截图,其模拟性能高度依赖 USB 数据集中特定电商平台(如 Alibaba)的页面布局、交互控件和商品呈现方式。当迁移至不同电商平台、跨领域推荐场景或不同文化背景的用户界面时,模型的视觉理解能力和行为先验可能失效。论文未提供跨平台或跨数据集的迁移实验,因此其泛化能力尚未得到验证。
  • 计算与部署成本较高。RecVerse 采用轨迹级强化学习训练,并需在每一步维护工作记忆、情景记忆和偏好记忆,同时还要处理截图输入,这导致训练阶段需要大量交互轨迹,推理阶段亦存在较高的计算延迟。相比传统基于规则或监督学习的模拟器,其资源消耗和响应时间可能难以满足工业级实时仿真或大规模并发的需求,论文未讨论工程化优化方案(如缓存、蒸馏或压缩)。
  • 奖励设计的局限性与超参敏感性。宏观奖励仅匹配动作类型分布,微观奖励匹配购物意图,两者从统计层面约束模拟行为,但无法捕捉用户购物中的情感波动、后悔决策、跨会话兴趣漂移等复杂动态。此外,宏微观奖励的加权系数和格式奖励的惩罚力度需要人工调节,可能引入新的模拟偏差。论文未提供鲁棒的自动化调参方法,也未分析奖励权重对模拟质量的影响。
论文Jiakai Tang2026-08-21原文

相关内容