论文

VisualClaw:面向物理世界的实时个性化智能体

VisualClaw:面向物理世界的实时个性化智能体

视觉语言模型正成为复杂多模态任务的通用接口,但其部署仍面临三大差距:处理密集视频帧和长提示时的高延迟与成本、部署后智能体框架的静态性、以及标准视频QA基准无法测试智能体在工具使用工作区中利用视觉证据的能力。 VisualClaw 是一种自进化多模态智能体,其核心设计基于两个原则: 1. 混合编码:通过级联门控过滤低信息流帧,并采用热/冷 top-k 注入压缩文本技能库,从而大幅降低部署成本。 2. 技能进化:让智能体从失败中学习——检索的记忆作为直接上下文或引导证据,驱动进化器更新技能库,以提升未来问题的解答能力。 在4个视频QA基准测试中,使用2种VLM,VisualClaw 将每次问答API成本降低平均98%(对比全帧上传),相较于离线均匀8帧基线降低25.9%,同时准确率普遍提升:例如在 EgoSchema 上配合 Gemini 3 Flash 平均提高3.85%,峰值达15.80%。为弥补基准缺口,我们构建了 VisualClawArena,一个包含200个场景的多模态智能体基准,通过严格五阶段流水线要求模型在工作区内使用视频证据、文档、动态更新和可执行检查。在该基准上,框架结合计算机使用智能体后端,相比无进化基线,Codex (GPT-5.5) 的宏观准确率提升2.9%,Claude Code (Sonnet 4.6) 提升3.2%,成本比均匀采样基线降低9.5%。这些特性使 VisualClaw 非常契合边缘应用:级联机制将1小时流式会话从约3600次API调用降至仅5-20次,自进化能力使其成为理想的个性化助手。

论文精读

TL;DR VisualClaw 提出级联过滤+技能演化框架,将实时视频 agent 的 API 调用量削减两个数量级,同时让模型从失败中自演进,在多个基准上实现成本暴降与精度反超。

问题

当前领域关注:将视觉语言模型(VLMs)作为通用接口驱动复杂多模态任务,尤其在视频理解与物理世界代理方面。

现有方法局限

  • 高昂部署成本:处理密集视频帧与长提示时,VLMs 延迟高、API 调用费用大;例如 1 小时流媒体会话可能产生约 3,600 次上传,难以在实时或边缘场景落地。
  • 静态代理架构:多数代理框架部署后固定,无法从使用中持续改进,导致对重复性或个性化需求适应性差。
  • 基准测试脱节:标准视频问答(video-QA)基准不检验代理是否能在工具类工作区内利用视觉证据,难以评估真实世界中 agentic 行为。

问题难点与重要性

  • 在保持或提升准确率的前提下,大幅降低 VLMs 推理成本是一个核心工程挑战——既要筛选关键帧、压缩文本提示,又不能破坏多模态上下文完整性。
  • 实现自我演进(self-evolution)要求代理具备从失败中学习的能力,这涉及记忆检索、证据引导与技能库更新,技术链路长且容易引入漂移。
  • 缺乏针对工具使用与动态环境的多模态基准,使得系统性能难以客观衡量。业界急需一种低成本、自适应、可验证的代理方案,以推动 VLMs 在边缘计算、个性化助手等领域的落地。

行业类比:这类似在自动驾驶中,既要实时分析道路视频流,又要依据历史驾驶经验更新策略——不是简单地把每一帧送入云端模型,而是本地筛选关键信息并持续进化驾驶风格,确保安全、高效且个性化。

核心洞察

  • 成本与精度的 Pareto 改进:VisualClaw 通过级联门动态过滤低信息量帧和冷热 Top-K 注入压缩技能库,实现了 API 调用成本降低 ~98% 且多数基准精度提升(如 EgoSchema 上 Gemini 3 Flash 提升 15.80%)。这打破了以往 VLM 部署中成本与精度需权衡的假设,其关键在于让模型仅处理含视觉证据的关键帧,并将技能知识高效组织为可检索上下文,从而减少冗余输入并避免长上下文导致的注意力稀释。相比均匀采样等方法,这种自适应选择与压缩机制更贴近实际流媒体场景。
  • 基于失败经验的自我进化:不同于静态代理或简单记忆检索,VisualClaw 利用错误案例生成技能更新,通过检索记忆引导进化器直接修改技能库。该机制让代理在推理过程中持续改进,实现个性化适应,无需额外微调。与传统记忆增强或上下文示例不同,它主动合成新技能,使未来问题受益。在 VisualClawArena 上,进化后的代理精度提升 2.9-3.2%,且成本更低,表明该机制能有效迁移至复杂代理工作流,为边缘部署中的长期自适应助手提供了可行路径。

方法

输入:连续视频帧流与用户多模态查询(文本+图像)。

关键模块

  • 级联编码门(Cascaded Encoding Gate):每帧经轻量门控评分,过滤低信息帧,仅高信息帧送入VLM。级联设计允许早期丢弃无效帧,大幅压缩帧数,从每小时~3600次API调用降至5–20次。
  • 技能库与混合热冷注入(Skill Bank with Hybrid Hot/Cold Injection):预存文本提示的技能库。对每个问题,按相关性注入“热”提示(强相关)和“冷”提示(通用知识),通过top-k选择压缩上下文长度,避免长提示导致的高延迟和高成本。
  • 记忆增强元进化(Memory-Augmented Meta-Evolution):从历史交互检索失败案例的记忆,作为进化器(Evolver)的上下文。进化器通过直接拼接(cat mode)或引导证据(guided mode)生成技能库更新,使agent从错误中学习,持续优化后续表现。

输出:agent生成动作或答案,并可在工作空间内调用计算机使用工具(如文档读写、动态更新),完成复杂的多步任务。

与同类方法的差异:与部署后静态不变的agent框架不同,VisualClaw通过在线混合编码动态压缩输入,并以失败驱动的记忆进化实时更新技能库,在显著降低API成本(平均−98% vs. 全帧上传)的同时,精度超越均匀采样基线(平均+3.85%),尤其适合持续交互、资源受限的边缘场景。

实验

实验设计

VisualClaw 在四个视频问答基准(包括 EgoSchemaEgoPlan-Bench)上评估,比较逐帧全上传(full-frame)与均匀 8 帧抽样的离线基线。引入自建基准 VisualClawArena:200 个多模态代理场景,强制要求利用视频证据、文档、动态更新和执行检查。实验覆盖不同的 VLM 后端,如 Gemini 3 FlashCodex(GPT-5.5)Claude Code(Sonnet 4.6),并对比有无进化的 Agent 框架。成本与准确率在两类任务上同时测量,重点验证混合编码与技能进化的效果。

关键发现

  • 成本大幅下降:级联编码(cascaded gate)平均削减 98% 的 API 调用成本(视频 QA),在边缘流式场景中将 1 小时的约 3,600 次上传降至 5–20 次。
  • 准确率逆势提升:在 EgoSchema 上,Gemini Flash 平均准确率上升 3.85%,峰值达 +15.80%;VisualClawArena 上 Codex 宏准确率提升 2.9%,Claude Code 提升 3.2%。
  • 进化机制有效:从失败中学习、更新技能库,带来跨模态的泛化——agentic 任务上即使未直接训练,也能转移能力。
  • 效率与性能兼得:在匹配帧数条件下,级联填充(cascade-fill)方案全面优于均匀 8 帧基线,说明利用时序冗余的筛选策略有效。

与基线对比的深度解读

基线(全帧或均匀帧)牺牲成本换取完整信息,而 VisualClaw 通过 混合编码(cascaded gate + hot/cold top-k 注入)动态压缩信息,保留关键视觉证据。这种设计使得在大多数设置中不仅不损失精度,反而因避免冗余帧的噪声而提高答案质量。与记忆增强的离线进化相比,在线 meta-evolution 允许 Agent 在交互中自我提升,无需重训,直接在部署期间适应新问题。在 VisualClawArena 中,即使代理任务包含非视频要素(文档、执行检查),技能进化同样带来增益,证明该方法不局限于纯视频领域,为面向开放世界的个性化助手提供了可行路径。

行业影响

落地场景

VisualClaw 的实时级联编码与自进化能力,使其天然适配需要持续视频流分析的产品。例如:

  • 个人 AI 助手 / 可穿戴设备:AR 眼镜或手机摄像头持续感知环境,实时回答用户问题,同时将 API 调用量从千级降至十级,满足边缘端延迟与流量约束。
  • 视频监控与安防:多路摄像头流中动态筛选关键帧,结合历史记忆进化的异常检测规则,减少人工复核成本。
  • 电商直播分析:自动提取商品展示片段、回答消费者外观问题、检测违规内容,替代人工或粗粒度抽帧方案。
  • 医疗影像实时协作:手术或内镜视频中,仅上传包含器械或病灶变化的帧到远端模型,辅助诊断与教学。

商业价值

核心价值在成本与体验的同步优化

  • API 成本削减一个量级:级联门控在 1 小时流中仅需 5-20 次调用,相比全帧上传降低 ~98%,使实时视频智能体商业模式可行。
  • 准确率提升:在 EgoSchema 上最高 +15.8% 精度,且技能进化使系统越用越准,直接改善用户留存与付费意愿。
  • 边缘部署友好:混合编码与热/冷注入无需重训 VLM,降低硬件与带宽门槛,适合 IoT 生态扩展。

与现有产品/工作流的接口

VisualClaw 作为即插即用的智能体框架,可轻松嵌入现有 VLM 调用栈:

  • 透明代理层:在视频采集与 VLM API 之间,部署级联门控和技能库,对外提供统一视频-QA 接口,不改变下游模型。
  • 记忆与进化引擎:技能进化模块可通过向量数据库与重排器,与现有 Agent 框架(如 LangChain、AutoGen)集成,从失败日志中自动产出新技能。
  • 基准对接VisualClawArena 提供 200 个需要文档、动态更新、执行检查的 agentic 场景,可直接用于评估现有智能体在工具使用空间中的视觉证据利用能力。

具体用例

  1. 电商直播智能解说:某电商平台在直播流中引入 VisualClaw,级联门控仅上传主播展示商品的特写帧,技能库存储常见问答(如材质、尺寸),单次直播 API 成本降至约 1/50,同时实时回答准确率提升 5%,用户互动率提高。
  2. 远程医疗手术示教:医院手术录像通过 VisualClaw 自动标注关键步骤并生成即时问答,技能进化从历史案例中提炼诊断规则,减少专家事后复盘时间,使培训系统的更新周期从月级缩至天级。

局限

  • 论文方法对基础 VLM 的推理能力有较强依赖,skill bank 的初始冷启动和跨 VLM 迁移时的格式对齐问题(如附录所述)可能限制零样本部署。实验主要在 Gemini 3 Flash、Codex、Claude Code 等闭源模型上进行,开源模型上的表现未经充分验证,缺乏对 skill evolution 在弱能力 VLM 下是否仍然有效的分析。
  • VisualClawArena 尽管经过严格五阶段筛选,但仅包含 200 个场景,覆盖的复杂度和领域有限,且主要面向工具使用类任务,对其他类型的具身交互(如物理操作、社交推理)的代表性不足。基准构建中的 text-only leakage gate 虽防止了文本捷径,但可能也排除了部分有效多模态样本,影响任务多样性。
  • 级联门控和 hybrid injection 的 top-k 等超参数需要根据具体 VLM 和基准进行网格搜索或启发式调整(如附录中的 trade-off 分析),缺乏自动化或自适应的设定策略。在流式部署中,若场景分布发生偏移,静态门控阈值可能导致关键帧被错误丢弃,尚未讨论在线校准或动态阈值调整机制。
论文Haoqin Tu2026-06-15原文

相关内容