Claw-Anything: 对具有更广泛用户数字世界访问权限的始终在线个人助手的基准测试
大型语言模型代理正被设想为始终在线的个人助手,能够访问用户数字世界中的任何相关内容。然而,当前系统仅在其狭窄范围内运行,限制了上下文敏感推理和有效协助。现有基准也仅提供部分用户状态,因此无法在此类广泛、始终在线的场景中捕获性能。为填补这一空白,我们引入 Claw-Anything 基准,该基准沿三个维度扩展代理上下文:长时程活动历史、相互依赖的后端服务以及跨多设备的集成 GUI 和 CLI 交互。为实例化此设置,我们通过多轮事件注入模拟数月的用户活动,产生复杂的世界状态和现实噪声(包括无关事件和冲突信号)。代理必须推理丰富的上下文环境,同时对此类噪声保持鲁棒。这种扩展范围还使得能够评估主动协助能力,要求代理预测用户需求并及时提供推荐。 实验表明,GPT-5.5 仅达到 34.5% pass@1,远低于先前基准,凸显了当前代理能力与始终在线个人助手需求之间的差距。伴随基准,我们发布了一个自动数据生成流水线,产出 2,000 个训练环境,并将基础模型提升 23.7%,证明了可扩展数据基础设施的效用。
论文精读
TL;DR Claw-Anything 基准测试通过模拟数月用户活动、多设备 GUI/CLI 及多后端服务,评估始终在线 AI 助理的上下文推理与主动辅助能力,揭示当前模型(GPT-5.5 仅 34.5% pass@1)与真实世界需求间的显著差距。
问题
问题背景:大语言模型驱动的智能体(agent)正朝着始终在线的个人助理演进,核心目标是让其全面访问用户数字世界中的一切信息,实现上下文感知的主动服务。
现有方法局限:当前智能体系统仅能操作数字世界的狭窄切片,例如单一应用或设备,缺乏对长期活动历史、跨后端服务依赖及多设备交互的统一建模。已有基准测试也只提供片段化的用户状态,忽略了现实中的无关事件与冲突信号噪声,导致评估结果无法反映智能体在真实复杂环境下的推理与协助能力。此外,这些基准几乎未涉及主动协助的评估,即智能体是否能在用户未提出请求前预判需求并给出及时建议。
技术挑战与重要性:构建贴近现实的始终在线助理基准需要模拟数月级跨度、多服务交织、GUI与CLI混合交互的用户活动,并通过事件注入生成复杂的世界状态与逼真噪声。智能体必须从海量上下文中提取关键信号,忽略干扰,这对其长程记忆、多步推理和鲁棒性提出了极高要求。本基准首次量化了这一难度:GPT-5.5的 pass@1 仅为34.5%,远低于以往简化基准上的表现,揭示了当前模型能力与真正实用化个人助理之间的巨大差距。随基准发布的自动化数据生成管线可产出2000个训练环境,将基座模型性能提升23.7%,证明了可扩展数据基础设施对缩小该差距的价值。
行业类比:就像自动驾驶系统需要感知全向交通环境而非仅跟随前车一样,个人助理必须全面理解用户的数字足迹——包括历史行为、多设备操作和服务间关联——才能做出精准、前瞻的决策。
核心洞察
- **Claw-Anything** 通过扩展三大上下文维度(长期活动历史、互依后端服务、跨设备 GUI/CLI 交互)首次模拟了真实“始终在线”个人助理所需的完整用户数字环境。与仅提供部分用户状态的现有基准(如 GAIA、WebArena)不同,它引入了多轮事件注入生成数月模拟活动,产生复杂世界状态和包含无关事件、冲突信号的现实噪声。这种设计迫使 agent 在丰富的上下文噪声中保持推理稳健性,从而暴露当前模型对长程、多模态依赖的处理缺陷——GPT-5.5 仅取得 34.5% pass@1,远低于此前基准上的表现,清晰量化了从“窄域工具”到“泛在助理”的能力跃迁缺口。
- 该工作首次在基准中系统评估 **主动辅助**,要求 agent 根据历史上下文预测用户需求并适时推荐,而非被动响应指令。这一设定与同步发布的可扩展数据生成流水线紧密结合:自动生产 2000 个训练环境,使基模型提升 23.7%。这揭示了“始终在线”助理的双重瓶颈——不仅需要更强的上下文推理,还需大规模、高保真的训练数据,而该流水线为构建此类助理提供了低成本、可复现的数据基础设施路径,对 AI 工程化落地具有直接参考价值。
方法
输入:用户画像与活动模拟
Claw-Anything 的构建始于一个丰富、可定制的 用户画像 (persona),它定义了用户的角色、偏好、日常习惯、使用的软件服务(如邮件、日历、通讯工具)以及多种设备(GUI 桌面端、CLI 终端等)。基于该画像,多轮事件注入 (multi-round event injection) 模块生成长达数月的模拟活动历史,包括:
- 跨服务、跨设备的事件序列(如 GUI 点击、CLI 命令、API 调用、消息收发)
- 真实噪声(无关事件、冲突信号),迫使 agent 在杂乱上下文中分辨关键信息
关键模块:自动任务生成管道
- Persona Creation and Enrichment
利用 LLM 从种子模板扩展出详细的人物背景,确保覆盖多样化的数字生活场景。 - Multi-Round Event Injection
模拟时序相关的用户行为与后端服务状态变迁,形成复杂的 世界状态 (world state)。每一轮注入可能触发连锁更新,使不同服务间产生依赖和冲突。 - Task Query and Verifier Generation
从活动历史中自动挖掘可问询、可操作的任务(如信息摘取、近期事件推理、前瞻性建议),并为每个任务生成一个 自动评分验证器,用于精确判断 agent 响应是否正确。 - Task Validation
滤除歧义或不可解的任务,保证基准的纯净度与可评估性。
输出:Always-On 个人助理基准
最终产出 Claw-Anything 基准,每个样本包含:长程上下文(活动日志)、依赖服务状态、多设备交互痕迹,以及一个任务-答案对(支持 pass@1 准确率评估)。基准涵盖 被动问答 与 主动辅助(proactive assistance)两类任务,后者要求 agent 在未被明确提问时预判用户需求并给出及时建议。为支持规模化训练,同时开源了自动化数据生成管道,可产出 2,000 个训练环境。
与同类方法的差异:现有基准(如 WebArena、OSWorld)仅提供局部、单时间片的用户状态,而 Claw-Anything 首次系统性地引入长期历史、服务互依赖、跨设备交互三大维度,使评估更贴近真实“始终在线”场景。
实验
实验设计
Claw-Anything 通过多轮事件注入模拟数月用户活动,构建包含长跨度活动历史、多后端服务依赖、GUI/CLI 跨设备交互的复杂世界状态,并引入无关事件与冲突信号作为噪声。评估任务涵盖被动查询与主动推荐,要求模型在丰富上下文环境中推理并保持鲁棒性。实验以 pass@1 为主要指标,评测 GPT-5.5 等前沿模型。
关键发现
- 即便最强模型 GPT-5.5 在 Claw-Anything 上仅取得 34.5% pass@1,大幅低于其在先前窄域基准上的表现,揭示当前智能体在“永远在线”个人助理场景中存在显著能力缺口。
- 噪声干扰与长上下文一致是失败主因,模型常被无关事件误导或遗忘关键信息。
- 发布的自动数据生成管道可批量产出 2,000 个训练环境,利用生成数据微调后基础模型性能提升 23.7%,验证了可扩展数据基础设施的效用。
与基线对比
相较于已有基准仅提供部分用户状态和短跨度交互,Claw-Anything 首次系统性引入多维度扩展上下文与主动协助评估。在以往基准上,顶尖模型常接近饱和,但 Claw-Anything 的通过率骤降,说明永远在线个人助理的真实复杂性远未解决。这一差距为后续研究指明了方向:需要更强的长程记忆、抗噪推理及主动意图理解能力。
行业影响
落地场景
Claw-Anything 定义的“始终在线”个人助理能力可直接催生新一代跨设备、跨应用的智能 Agent 产品。典型场景包括:
- 全时智能手机助手:不止响应用户指令,更能基于数月级的聊天记录、日历、邮件、浏览历史主动建议行程、提醒待办、甚至代填表单。
- 智能家居中枢:通过 CLI/GUI 同时控制物联网设备与第三方服务,如根据用户过去几周的作息学习灯光与温控策略。
- 办公辅助 Agent:融合邮件、会议、文档、代码仓库等多源事件,自动生成周报、追踪任务依赖、提醒关键截止日期。
商业价值
- 降本:主动任务执行减少人工操作频次,如自动处理报销、日程协调,降低个人助理或行政支持成本。
- 增收:基于长期上下文的推荐(如电商、内容平台)更精准,提升转化与复购;企业版服务可形成付费高级功能。
- 体验提升:零延迟的主动协助能大幅增强用户粘性,形成差异化竞争壁垒,尤其适合高端手机、智能座舱等追求极致用户体验的产品线。
与现有产品的集成接口
Claw-Anything 具备非侵入式集成特性:
- 标准化工具调用:其评估框架基于 GUI/CLI 操作,可对接现有自动化工具(如 Selenium、ADB)和 API 网关,直接控制真实应用。
- 自动化数据流水线:论文发布的训练环境生成器能批量产出多用户、长时域沙盒,可嵌入 MLOps 流程,持续微调 Agent 模型。
- Agent 框架兼容:作为基准,可测评基于 LangChain、AutoGPT 等构建的助手,也可将其生成的数据用于 SFT/RLHF,提升已有助手对噪声和冲突信号的鲁棒性。
具体落地 Use Case
电商全域购物助手
助手持续监听用户的浏览、搜索、比价行为,结合支付日历与促销事件。当检测到用户收藏的某款耳机出现历史低价且正值其生日前一周,主动推送最优购买路径并生成比价报告,一键跳转到结算页面。此场景需要跨应用(电商 App、短信、日历)的长上下文与主动决策,正好对应 Claw-Anything 的多设备、多服务评估维度。医疗健康主动管理 Agent
连接可穿戴设备、电子病历、药房系统。Agent 根据用户过去半年的睡眠、心率、运动数据,提前预测疲劳高峰期,自动建议调低次日工作日程强度,并预约虚拟就诊。若药品库存低于阈值或出现用药冲突,直接通知用户和家庭医生。此处对随机噪声(如误读数据)和冲突信号(用户自行服药)的鲁棒性正是该基准强调的能力。
当前 GPT-5.5 仅 34.5% 的 pass@1 表明商用化仍存差距,但23.7% 的基于生成数据的提升已指明通过大规模仿真环境迭代优化的可行路径。
局限
- 合成环境与用户行为的保真度挑战:尽管通过多轮事件注入模拟了数月的用户活动,但生成的交互序列仍基于预设规则与模型合成,可能缺乏真实用户行为中的突发性、多义性及隐私限制。模拟的后端服务状态(如日历、邮件)是理想化的,无法完全复现现实世界中 API 变更、服务中断或用户非典型操作产生的边缘情况。这导致基准测试中的高分可能在真实部署中显著衰减,因为真实世界的上下文噪声与信号冲突模式更为复杂和难以预测。
- 评估指标与任务覆盖的局限:当前仅报告 pass@1 指标,侧重单次响应的正确性,忽略了代理在多步推理与错误恢复中的潜力(如 pass@k)以及资源效率(如 token 消耗、延迟)。任务设计虽覆盖长期历史与 proactive 推荐,但可能偏向日程、消息类场景,对持续性的个性化建模(如用户偏好演化、情感感知)评估不足,限缩了基准对 always-on 助理全貌的反映能力。
- 扩展性与隐私建模缺失:自动化数据生成管道虽可产出 2000 个训练环境,但模拟全用户数字世界(多设备、多服务、长时程)的计算开销巨大,可能限制大规模语言模型在此基准上的快速迭代训练。此外,基准假定代理可无障碍访问用户所有数字信息,未建模真实部署中必需的动态权限管理与隐私边界,使评估脱离实际工程约束,可能高估可用性。