论文

FocusMem: 在潜在 GUI 记忆中分解内容、读取和信任

FocusMem: 在潜在 GUI 记忆中分解内容、读取和信任

GUI 智能体需要同时记住早期任务的有用经验和当前交互中的未完成进度。潜在记忆通过将多模态轨迹压缩为几个连续 token 来提供紧凑的解决方案。然而,现有方法通常将每条轨迹映射到一个固定记忆块,并主要通过下一动作监督进行训练,导致三个实际问题:压缩中重要细节可能丢失;同一记忆块必须服务于不同决策阶段;不相关的检索轨迹仍可能误导智能体。 为此,FocusMem 在紧凑的潜在记忆接口中分离这些职责:角色感知内容基础(role-aware content basis)鼓励情景记忆保留可复用经验、工作记忆保留任务进度;状态条件读取(state-conditioned readout)为同一存储证据生成决策特定视图;轻量级信任门控(trust gate)可抑制与当前步骤不相关的记忆块。所有组件均在 GUI 策略保持冻结 的情况下训练。 在 五个 GUI 智能体基准 上,FocusMem 一致优于完全匹配的仅动作固定记忆基线和先前的潜在记忆改造方法。进一步分析表明:语义与功能监督保留了互补信息;状态条件读取在周围轨迹上下文增长时更鲁棒;信任门控减少了注入不相关情景证据所造成的危害。这些结果说明,有效的潜在记忆不仅依赖对过去交互的压缩,还取决于保留什么、暴露什么、允许什么。

论文精读

TL;DR FocusMem 将 GUI 智能体的潜在记忆分解为内容基、状态条件读出与信任门控,在冻结策略下训练,通过分离“记住什么、暴露什么、允许什么”显著提升记忆的鲁棒性。

问题

问题背景

GUI 智能体需要从历史交互中复用经验(episodic memory)并跟踪当前任务进度(working memory),以完成复杂多步操作。潜空间记忆(latent memory)通过将多模态轨迹压缩为少量连续 token,提供了一种紧凑的记忆表示方案。

现有方法局限

当前潜记忆方法通常将每条轨迹映射到一个固定记忆块,并主要依赖下一动作监督进行训练。这带来三个工程瓶颈:

  • 压缩失真:重要细节在强压缩中被丢弃,恢复困难;
  • 阶段冲突:同一记忆块需同时支持不同决策阶段,导致信息混杂;
  • 无关干扰:检索返回的无关轨迹仍会误导当前决策。

难点与重要性

潜记忆的挑战在于表示容量与选择性使用的权衡:既要保留足够语义,又不能引入噪声。工业界对 GUI 自动化、RPA、虚拟助手的需求日益增长,记忆机制直接决定智能体在长程多任务中的可靠性与泛化能力。若无法解耦内容存储与动态读取,记忆增强会降级为额外上下文负载。

行业类比

类似大语言模型中,上下文长度增加时需有效注意力选择以忽略无关 token——GUI 潜记忆同样需要根据当前状态主动过滤记忆块,而非被动喂入全部检索结果。

核心洞察

  • 潜存记忆的职责分解(**角色感知内容基础** + **状态条件读出** + **信任门**)将记忆的压缩、表达与筛选解耦到独立组件中。与以往单一固定记忆块的方法不同,FocusMem 让情节记忆与工作记忆各司其职,读出层按决策阶段动态生成视图,解决了压缩时细节丢失、同一记忆块服务多阶段冲突的问题。这种模块化设计使记忆接口的每一部分都可针对性地优化或替换,为工程落地提供了更灵活的插拔式架构。
  • 信任门提供了一种主动抑制机制,它不单纯依赖检索相似度,而是根据当前决策步骤的上下文,对检索到的记忆块计算相关性得分并低度相关的干扰。在 GUI 代理的长程交互中,检索难免引入噪声,信任门能在不修改原始记忆内容的条件下动态屏蔽有害证据,实验表明注入不相关情节记忆时,信任门显著降低了错误率,这让记忆增强代理在面对检索质量波动时更加稳健。

方法

输入与记忆构建

GUI Agent 在每个时间步接收多模态观测(截图、DOM、指令等)和动作历史,FocusMem 将其压缩为两类潜记忆:

  • 情节记忆(Episodic Memory):从已完成任务中提取可复用经验,编码为一组连续 token。
  • 工作记忆(Working Memory):记录当前交互的未完成进度,由近期轨迹压缩而成。 两类记忆共享一个 角色感知的内容基(role-aware content basis),通过不同投影方向在同一潜空间中强调各自保留的信息,避免压缩过程中丢失关键细节。

关键模块:状态条件读出与信任门

记忆块本身是固定长度的潜向量,但不同决策阶段需要不同的信息视图。状态条件读出(state-conditioned readout) 以当前观测和任务状态为条件,动态生成注意权重,从同一存储证据中抽取与当前决策相关的片段。读出的结果作为策略网络的附加输入,却不改变原始 GUI 策略的参数。

为避免无关记忆误导动作预测,轻量信任门(trust gate) 对每个检索到的情节记忆块输出 0~1 的权重,监督信号来自该记忆块对下一动作预测的实际贡献(通过辅助损失学习)。权重接近 0 的记忆块会被抑制,有效阻断干扰。

训练机制与输出

整个记忆接口在冻结的 GUI 策略之上训练,仅更新记忆编码器、读出网络和信任门。训练使用多任务损失:

  • 动作预测损失:下一动作的最大似然,保证记忆对决策有用。
  • 语义保持损失:鼓励记忆保留关键实体、意图等语义信息。
  • 功能监督损失:让记忆保留可执行的操作序列模式,提升复用性。 最终输出是增强后的动作分布,Agent 据此选择 GUI 操作。

与同类方法的差异:现有潜记忆方法通常将整条轨迹压缩为单一固定块,且仅通过动作监督训练,而 FocusMem 将内容保留、读出视图和相关性判定三者解耦,并在冻结策略下引入语义与功能双重监督,使记忆既全面又精准。

实验

实验设计

FocusMem 在五个 GUI agent 基准测试上进行了评估,涵盖网页、移动和桌面环境。基线包括一个完全匹配的 action-only fixed-memory 模型以及先前的工作如 Latent Memory Adaptation。实验设计冻结了策略模型参数,仅训练记忆组件,以考察对记忆机制本身的增益。

关键发现

  1. 语义与功能监督保留互补信息:分离式记忆体(episodic vs working)能各自保留可重用经验和任务进度。
  2. 状态条件读出(state-conditioned readout)更鲁棒:当轨迹上下文增长时,动态视图比固定记忆块更能提取决策所需证据。
  3. 信任门(trust gate)有效抑制噪声:注入无关经历时,门控机制降低了误导性检索块的危害。
  4. 在所有基准上,FocusMem 均超越仅动作监督的固定记忆基线及先前的潜在记忆适配方法。

基线对比解读

相比固定记忆块和早期潜在记忆方法,FocusMem 的核心优势在于责任分离:内容基底保留与任务相关的不同侧面,读出模块提供决策特定视角,门控过滤无关信息。这种解耦设计避免了传统方法中重要细节压缩丢失、同一记忆服务多阶段决策以及无关检索干扰等问题。消融分析表明,每一组件对性能均有贡献,且三者协同实现了更可靠的记忆增强,验证了“有效潜在记忆不仅依赖压缩,更依赖保留什么、暴露什么、允许什么”的核心论断。

行业影响

落地场景

FocusMem 主要面向需要长期上下文记忆与多步骤交互的 GUI 自动化代理,典型产品包括:

  • RPA 流程自动化:跨应用的复杂业务流程(如财务月结、客户入驻审核),代理需记住已完成步骤与中间结果,避免重复操作,FocusMem 可提供更紧凑且抗干扰的记忆。
  • 企业级虚拟助手/数字员工:处理多轮对话与软件操作混合的任务(如修改订单、管理工单),代理既要记住用户历史偏好,也要保持当前任务进度,分离式记忆能提升成功率。
  • 自动化测试:UI 回归测试中,代理能复用以往探索路径,避免在无关模态上浪费重试,信任门控 可抑制不相关经验。

商业价值

  • 降低自动化维护成本:传统记忆方案在环境变化时容易失效,需要人工重标注或策略调整;FocusMem 的 状态条件读出 与 信任门控 使记忆更具泛化性,减少重复调优。
  • 提升任务完成率与客户体验:在客服自动化场景,准确的进度记忆可避免重复询问或错误操作,直接提升解决率;对于内部运营,更稳定的代理可缩短流程处理时间,间接带来人力节省。
  • 减少决策失误的连锁代价:信任门 显式抑制无关记忆,在金融对账、保险理赔等精确场景中,能避免因错误记忆导致的资金风险。

与现有产品/工作流的接口

FocusMem 设计为与已冻结的 GUI 策略 共同训练,能以插件形式集成进现有框架:

  • 输入侧:接收多模态轨迹(截图、动作序列),输出少量连续记忆令牌。
  • 策略层:将记忆令牌追加到原有观测中,无需修改动作预测头的架构。
  • 记忆模块可独立部署为微服务,或嵌入端侧代理程序,通过轻量 读出 与 信任门 控制介入幅度。

具体落地场景示例

  1. 电商售后自动化:代理处理退款流程时,需记住前一步填写的退款原因与金额(工作记忆),同时回忆类似订单的常用处理模式(情景记忆)。FocusMem 保证进度不丢失,且信任门可屏蔽无关历史(如不同品类的处理规则),防止决策串扰。
  2. 金融报表生成:RPA 代理每日从多系统抓取数据,制作合并报表。中间步骤(已下载哪些文件、已校验哪些表)需要可靠的进度记忆;同时,上月操作经验可复用,但若当前报表结构变更,状态条件读出 可动态适应新上下文,信任门会自动降低旧记忆的权重。

局限

  • 方法训练时 GUI 策略被冻结,虽然降低了训练复杂度,但也限制了记忆模块与策略之间的协同优化。在更复杂的任务分布或策略需要适应记忆内容时,冻结策略可能不是最优选择。若策略参数能够与记忆组件一同更新,或许能进一步挖掘潜力,但也会引入不稳定性和更高的训练成本。
  • 实验在五个 GUI-agent 基准上评估,但所有任务均来自相对受控的交互环境。真实世界 GUI 交互中存在大量噪声、中断和异常状态,注入不相关情节记忆的实验仅模拟了部分检索噪声,无法完全反映开放世界中记忆检索失败或混淆的模式。信任门的泛化能力在更嘈杂的检索环境下仍需验证。
  • 潜在记忆的容量和计算开销可能成为扩展瓶颈。每个记忆块都通过角色感知内容基础、状态条件读出和信任门处理,随着记忆块数量增加,注意力计算和门控决策的计算量会线性增长。论文未讨论大规模记忆库下的延迟与资源消耗,这可能限制其在低延迟要求下的实时 GUI agent 中的应用。
论文Zhuoran Zhang2026-08-05原文

相关内容