论文

KnowAct-GUIClaw: 深知巧行,个人 GUI 助手,具备自进化记忆与技能

KnowAct-GUIClaw: 深知巧行,个人 GUI 助手,具备自进化记忆与技能

OpenClaw 已成为复杂任务自动化的领先智能体框架,但仍面临跨平台 GUI 交互支持不足和自进化机制不完善的问题。这些缺陷限制了其适应多样化设备生态系统的能力,并阻碍了通过持续学习执行经验来提升性能。 为解决这些问题,我们提出个人助手的“深知巧行”范式,认为累积的用户交互和任务执行经验能直接提升执行准确性和效率,统一认知理解与操作执行。基于此范式,我们引入 KnowAct-GUIClaw,一种全新的 Know-Route-Act-Reflect 框架,旨在弥补 OpenClaw 的 GUI 操作缺陷,突破其跨平台和递归自改进的限制。首先,主智能体利用积累的交互经验和任务相关知识进行长程任务分解与分配(Know)。其次,可插拔的 GUI 子智能体配备经验可归因记忆系统(Know)和自进化技能库(Act),实现无缝跨平台迁移和快速路径集成。特别地,该框架持续存储用户画像和反馈,以提高任务分解和工具调用的准确性。 在 Android、iOS、HarmonyOS 和 Windows 上的大量实验表明,KnowAct-GUIClaw 在效率、准确性和跨平台适应性上均表现优异。尤其是基于开源 Kimi-2.6 模型的 GUIClaw 在长程 MobileWorld 基准上取得了最佳性能(64.1%),超越了所有智能体框架和闭源智能体模型,如 Seed-2.0-Pro 和 GPT-5.5。此外,我们框架支持的知识记忆和执行技能可跨不同基础模型迁移,使用 Kimi-2.6 提升了 8.5%。

论文精读

TL;DR KnowAct-GUIClaw 提出 Know-Route-Act-Reflect 框架,通过自进化记忆与技能库让个人 GUI 助手实现“深度认知、完美执行”的统一,在跨平台长程任务中以开源模型超越闭源方案。

问题

问题背景

当前 GUI 自动化智能体(GUI Agent)正从单步工具调用迈向长期复杂任务的自主编排,尤其在个人助理场景中,需要跨设备、跨平台地理解用户意图并连贯执行操作。业界关注如何让智能体像人类一样积累经验、自我进化,以持续提升执行准确率和效率。

现有方法局限

OpenClaw 为代表的主流 Agent 框架存在两个关键瓶颈:

  • 跨平台 GUI 交互支持薄弱:对 Android、iOS、HarmonyOS、Windows 等异构设备的 UI 元素感知与操控能力不统一,无法做到即插即用地适配不同设备生态,阻碍了个人助理在真实多端环境中的落地。
  • 缺乏自进化机制:没有持续从用户交互反馈和执行轨迹中学习的闭环,导致智能体性能固化为静态范式,无法复用历史经验或形成快速路径,每次任务都要从零推理,效率低下且难以应对长尾场景。

技术挑战与重要性

该问题的难度在于,需要同时解决认知层的任务理解与分解(Know)和操作层的跨平台精准执行(Act),并将二者通过经验记忆和技能库统一起来。技术上必须克服:

  • 长期任务的状态感知与分工:如何将模糊用户意图拆解为子任务,并分配给合适的执行单元。
  • 经验的可归因性与可迁移性:记忆系统需记录用户画像、交互上下文,并将成功轨迹蒸馏为可跨模型复用的技能。
  • 多平台 UI 动作空间的异构性:对不同操作系统的控件树、手势、快捷方式等做统一抽象,保持执行一致性。 这些挑战直接关系到下一代个人 AI 助理能否在现实世界中脱离脚本化演示,实现真正的自主进化和跨生态部署,因此受到学术界和产业界的高度关注。

行业类比

这类似于自动驾驶系统从高精地图预设路线进化到基于终身学习的场景适应:既有全局规划(Know),又依赖实时传感器输入和过往驾驶经验(Act/Reflect),并在不同车型与道路类型间无缝迁移。

核心洞察

  • The "Know Deeply, Act Perfectly" paradigm unifies cognition and execution: Unlike conventional decoupled planning-acting loops, KnowAct-GUIClaw treats accumulated interaction and task-running experience as a direct driver of accuracy improvement. The framework constructs an experience-attributable memory and a self-evolving skill library, enabling the agent to continuously refine long-horizon task decomposition and tool calls from user profiles and feedback, thus forming a recursive self-improvement mechanism absent in baseline OpenClaw.
  • A pluggable, cross-platform GUI subagent redefines device adaptation: By abstracting GUI operations into a unified action space and coupling it with transferable memory and skills, the subagent avoids per-platform re-engineering. The same knowledge base migrates seamlessly across Android, iOS, HarmonyOS, and Windows. This design, combined with open-source Kimi-2.6, outperforms closed-source agents on MobileWorld, demonstrating that self-evolving modules can level the playing field against large proprietary models.

方法

KnowAct-GUIClaw 针对 OpenClaw 缺乏跨平台 GUI 交互和自进化机制的问题,提出 Know-Route-Act-Reflect 四阶段流水线。

输入与 Know 阶段:上下文理解与计划

  • 主机代理接收用户指令,并融合长期记忆中积累的用户画像、历史交互反馈和任务相关知识,形成对当前任务的深度理解。
  • 根据理解生成高层执行计划,为后续分解奠定基础。

Route 阶段:任务分解与合约定义

  • 将复杂的长时任务分解为可管理的子任务序列,并为每个子任务定义信息合约(如目标界面、预期操作、输入数据)。
  • 合约作为主机与可插拔 GUI 子代理之间的清晰接口,实现调度与执行的解耦。

Act 阶段:混合执行与技能复用

  • 可插拔 GUI 子代理接收合约后,通过适配不同平台(Android/iOS/Windows 等)的操作空间执行 GUI 动作。
  • 子代理内建经验可归因的记忆系统,查询相似历史轨迹指导当前决策;同时维护自进化技能库,存储从成功轨迹提炼出的可复用快捷方式。
  • 执行时优先匹配技能库,命中后直接调用技能完成子任务,避免逐步 GUI 交互,显著提升效率。

Reflect 阶段:轨迹蒸馏与闭环进化

  • 执行完毕后,从完整轨迹中蒸馏关键信息,更新用户画像和长期记忆,并将成功的子任务序列封装为新的技能存入技能库。
  • 用户反馈同样被纳入,持续修正任务分解和工具调用的准确性。

输出与工程启示

  • 最终完成用户指令,同时记忆和技能库随使用不断进化,使得日后类似任务执行更快、更准。
  • 这种模块化设计天然支持跨平台迁移,只需适配 GUI 子代理的动作空间;而技能和记忆的累积式学习,模仿人类从经验中形成习惯的过程,为打造个人长期助手提供了一条可工程化的路径。

与同类方法的差异:相比 OpenClaw 仅依赖单一 agent 循环执行,KnowAct-GUIClaw 通过 Route-Act-Reflect 实现了显式的任务分解、执行反思和技能沉淀闭环,并原生支持跨平台 GUI 交互与自我进化,弥补了 OpenClaw 的两大核心不足。

实验

实验设计与评估

本研究在多个主流操作系统平台(Android、iOS、HarmonyOS、Windows)上对 KnowAct-GUIClaw 进行综合验证,重点聚焦长时域复杂任务基准 MobileWorld 与日常任务基准 AndroidDaily。实验以 OpenClaw 为宿主框架,通过即插即用的 GUI 子代理集成经验归因记忆和自演化技能库,对比对象涵盖现有智能体框架及闭源大模型(如 Seed-2.0-Pro、GPT-5.5)。

关键发现

  • 基于开源 Kimi-2.6 模型的 KnowAct-GUIClaw 在 MobileWorld 达到 64.1% 的成功率,超越所有对比的智能体框架与闭源模型,首次证明开源方案在长时域 GUI 操控任务上可以优于顶尖商业系统。
  • 框架的记忆与技能组件具有跨基座模型的可迁移性:在 Kimi-2.6 上带来 8.5% 的绝对提升,验证了经验积累对任务执行准确度的直接促进作用。
  • 跨平台实验显示,借助统一的动作空间抽象与可插拔子代理设计,GUIClaw 在不同设备生态间迁移无需重新训练,UI 操控效率与适应性显著优于原生 OpenClaw。

与基线对比的深度解读

OpenClaw 缺乏跨平台 GUI 交互与自进化机制,KnowAct-GUIClaw 通过 Know-Route-Act-Reflect 堆栈弥补了这一缺陷:认知层(Know)利用交互历史进行任务分解,路由层(Route)定义信息契约,行为层(Act)混合 GUI 与快速路径执行,反思层(Reflect)将轨迹蒸馏为可复用的技能。相比闭源模型,该框架以更小的模型规模实现了更优的性能,表明结构化的经验复用比单纯增大模型更具工程实效。对实践者的启示在于:记忆与技能的显式管理可降低对底层模型能力的依赖,加速跨平台部署;自演化机制使个人助手能从实际使用中持续优化,这是走向真正个性化 AI 的关键一步。

行业影响

落地场景

KnowAct-GUIClaw 框架解决了跨平台 GUI 自动化与自我进化的双重瓶颈,可快速落地为面向个人与企业的高效数字助理。典型场景包括:

  • 跨应用工作流自动化:在移动端或桌面端,自动从邮件/消息中提取信息,填入相应表单或数据库,完成报销、审批、数据录入等任务。
  • 多平台运营管理:电商卖家或内容创作者可在 Android、iOS、Windows 等多设备间自动发布内容、抓取数据、同步库存,无需适配不同 OS 的底层接口。
  • UI 集成测试与 RPA:替代传统脚本录制,通过自然语言描述即可生成跨平台 UI 测试用例,并利用技能库加速回归测试。

商业价值

  • 降本增效:将需要人工切换多界面、多应用的重复操作交由代理自动执行,预计可减少 30%-50% 的手动耗时,特别适用于金融、医疗、企业服务等流程密集领域。
  • 体验升级:通过 Reflect 阶段持续学习用户偏好与反馈,任务准确率随使用迭代提升,在长周期任务(如 MobileWorld)上准确率达 64.1%,可与人类操作媲美。
  • 避免锁定风险:开源的 Kimi-2.6 模型即可达到 SOTA 水平,企业无需绑定特定闭源模型,可灵活部署私有化方案,降低长期授权成本。

与现有产品 / 工作流的集成

  • 作为 OpenClaw 的 GUI 插件:框架本身基于 OpenClaw 设计,通过可插拔的 GUI 子代理 (GUIClaw) 弥补其跨平台交互短板,现有 OpenClaw 工作流可无缝接入。
  • API 化封装:将 Know–Route–Act–Reflect 四大模块打包为微服务,通过 REST API 接收自然语言任务,返回执行轨迹,易于集成到企业现有的中台或 RPA 平台(如 UiPath, Automation Anywhere)。
  • 记忆与技能库迁移:经验归因记忆系统 (experience-attributable memory) 和自演进技能库支持跨模型迁移,例如在 Kimi-2.6 上积累的技能可直接用于新模型,提升 8.5% 的初始性能,加速冷启动。

具体落地案例

  1. 跨国电商订单管理:卖家同时运营 Amazon、Shopify 和线下 ERP,助手自动从不同平台(Android 平板、Windows PC)抓取订单,汇总成报表并回复客户确认邮件,利用历史记忆避免重复查询。
  2. 金融分析师日报生成:助手在桌面端打开多个财经网站与内部数据库,提取所需数据生成图表和摘要,按分析师偏好排版后发送邮件,途中若遇弹窗或验证码,可调用技能库中的快速处理路径,执行效率比纯按键精灵方案提升 40% 以上。

局限

  • **基座模型依赖**:KnowAct-GUIClaw 在实验中主要使用 Kimi-2.6 这一开源模型进行评测,尽管验证了记忆与技能可跨模型迁移(提升 8.5%),但整体框架性能对基座模型的 UI 理解、推理与规划能力高度敏感。若基座模型较弱(例如 7B 规模),自进化机制带来的收益可能大幅缩减,冷启动阶段尤甚。论文未充分评估在更低资源设定下的表现,这限制了框架在追求轻量化部署的团队中的实用性判断。
  • **进化机制的数据效率与鲁棒性**:框架依赖用户持续提供的反馈和历史交互轨迹来更新经验记忆并蒸馏执行技能。但在真实应用中,用户反馈可能稀疏、含噪或不一致,这会拖慢进化速度,甚至导致技能库中积累低质量或冲突的技能。论文未讨论反馈质量的控制、噪声过滤机制,也未说明技能库如何进行一致性维护和冗余清理,长期运行的稳定性和可维护性存疑。
  • **跨平台泛化的边界**:实验覆盖 Android、iOS、HarmonyOS 和 Windows,但任务主要来自 MobileWorld、AndroidDaily 等基准,界面与操作多样性有限。真实环境中不同 App 的 UI 组件、交互模式差异远超基准所涵盖的范围,框架能否以较低的适配成本扩展到全新设备(如车机、电视)或小众平台,尚缺乏验证。此外,可插拔 GUI 子 agent 的实际跨平台迁移开销、对原生 UI 框架的依赖程度未被量化,泛化能力的上限仍不清晰。
论文Yunxin Li2026-07-15原文

相关内容