Agent 技能不应仅限于文本:视觉技能的必要性
可复用技能是扩展 agent 能力的关键机制,使 agent 能够积累经验并解决日益复杂的任务。然而,现有的大多数技能学习方法仅将可复用经验存储为纯文本资产,例如指令、推理轨迹或总结后的轨迹。我们认为,这种纯文本范式在视觉密集型任务中造成了根本性瓶颈,因为这类任务的可复用知识往往依赖于空间布局、视觉定位、细粒度外观和局部状态变化。 为解决这一局限,我们提出 VSkill,一种结合声明式文本逻辑与显式视觉支持的多模态技能范式。我们区分三种可复用形式:静态先验(用于稳定的空间惯例)、动态先验(用于原位视觉工作记忆)以及交织视觉技能(将有序文本步骤与对应的源帧、截图或页面区域绑定)。视觉技能不仅描述“做什么”,还编码“看哪里”、“如何检查”以及“如何验证视觉结果”。为规模化构建视觉技能,我们引入 VSkillSys,一个自动化系统,通过保留任务轨迹中的文本推理、空间参考、视觉边界和交互模式,将 agent 经验转换为可复用的多模态技能。 在 GUI 及其他视觉密集型任务上的实验表明,视觉技能在需要空间对应、视觉证据和状态感知交互的场景中持续优于纯文本技能。这些结果支持我们的核心论点:可复用的 agent 技能应超越文本,成为未来多模态 agent 的多模态资产。
论文精读
TL;DR 提出多模态技能范式 Visual Skill,将文本逻辑与视觉线索结合,解决纯文本技能在视觉任务中的空间理解瓶颈,实验证明其显著优于纯文本方法。
问题
问题背景
可复用技能是当前 AI 智能体 持续提升能力的关键机制,大量工作致力于让智能体从历史经验中提炼可泛化的操作知识(通常存储为文本轨迹、提示或指令),以应对越来越复杂的交互式任务。
现有方法的局限
然而,主流的 纯文本技能范式 在视觉密集型任务中暴露了明显瓶颈:
- 空间信息丢失:自然语言难以精确描述 UI 元素的绝对坐标、相对布局和视觉层级,导致基于文本的技能在需要精确定位时频繁失败;
- 视觉接地缺失:纯文本技能无法捕获“目标元素的视觉长相”“局部区域的像素变化”等细粒度外观特征,难以处理动态页面或高度近似的组件;
- 状态感知不足:任务执行常需验证视觉结果(如确认按钮已高亮、列表已更新),但文本技能无法编码“去哪里看、怎么看”这样的视觉审查步骤。
这些局限使文本技能在 GUI 操控、地图导航、界⾯监控 等需要持续空间对应和视觉证据的场景中性能退化。
为什么这个问题难且重要
技术挑战:视觉技能需要将文本逻辑与图像锚点、空间标注、时序画面变化进行跨模态对齐,同时保证生成效率与执行时的泛化力——静态先验、动态工作记忆和多步交错的视觉绑定三者之间实现责任分离与协同。
业界关注度:随着多模态大模型驱动的 Agent 产品(如操控手机/桌面的助手)进入落地阶段,纯文本技能已成为用户体验和任务成功率的核心掉分项。工业界正迫切需要一种不依赖大量人工标注、可自动从任务轨迹中提炼视觉技能的系统。
行业类比
这类似于 自动化测试框架 中仅用自然语言描述“点击登录按钮”而不提供选择器或屏幕截图时,测试脚本会在不同分辨率或主题下大量失效。视觉技能的本质,就是为智能体补上那套可以跨情境复用的“视觉选择器 + 验证截图”。
核心洞察
- 纯文本技能在视觉中心任务中形成根本性瓶颈:现有技能学习方法将可复用经验存储为文本指令、推理轨迹或总结,但当任务高度依赖空间布局、视觉接地或细粒度外观(如GUI操作、界面导航)时,文本无法编码“在哪里看”与“如何验证视觉结果”,导致 Agent 在需要精确空间对应和状态感知的场景中频繁失败。这与传统将技能等同于文本摘要的范式截然不同,点明多模态 Agent 必须将视觉结构提升为一等公民。
- 将逻辑与视觉分离的职责划分是视觉技能的核心设计:Visual Skill 范式让文本负责声明式逻辑(做什么),视觉部分承载空间参照与核查(在哪里、怎么查)。这一分离不仅优于单纯向模型输入原始图像(未经结构化的 few-shot 示例),也避免了文本与视觉模态相互干扰,使得技能既具备可解释的理性,又保留了对动态界面的适应能力,为构建鲁棒、可复用的多模态 Agent 技能提供了清晰的工程原则。
方法
输入:从执行轨迹中提取多模态经验
系统以智能体的任务执行轨迹为输入,每条轨迹包含时间序列截图、动作序列(点击、输入等)和相应的文本推理链。输入首先经过标准化处理,将不同来源的界面、分辨率统一为规范格式,并抽取出关键决策点(例如页面跳转、状态变化帧)。
视觉瓶颈门控:按需触发视觉技能生成
与无条件生成技能的范式不同,AutoVisualSkill 引入一个视觉瓶颈门控模块,评估当前任务是否高度依赖空间布局、视觉证据或细粒度外观。只有当文本描述无法充分传递可复用知识时(如“点击右上角齿轮图标”会因为不同界面中图标位置变化而失效),门控才会激活视觉技能生成流程,避免不必要的视觉存储膨胀。
双轨生成:文本逻辑 + 视觉证据
激活后,系统并行运行两条生成管线:
- 文本轨(Text Track):以结构化自然语言产出一系列可执行步骤,每一步明确做什么,并保留原始推理中的关键条件判断。
- 视觉轨(Visual Track):从原始截图中提取或重新生成视觉制品,主要包括:
- 静态先验:稳定的空间约定(如固定布局、UI组件相对位置)以标注框或热力图形式呈现。
- 动态先验:原位生成视觉工作记忆,用于跟踪界面中变化的目标(如进度条、动态列表项)。
- 交错视觉技能:将每个操作步骤与其对应的源帧、区域或截图绑定,形成
(步骤, 视觉证据)对。
视觉轨并非简单截图,而是通过执行导向的增强——对目标区域添加边界框、高亮或局部放大,并编码空间锚点(如“左侧导航栏第三项”的像素范围),使技能可直接被后续代理的感知模块消费。
输出:可即插即用的视觉技能制品
最终输出的视觉技能是声明式文本逻辑与结构化视觉支持的组合体,存储为标准化 JSON 模式,包含操作步骤、空间约束和视觉证据的序列。这些技能可以注入到新任务的提示中,作为少样本示例或工具调用的一部分,帮助代理解决同类视觉中心任务。
与同类方法的差异
与传统文本-only 技能库(仅总结指令或推理链)相比,AutoVisualSkill 将视觉结构提升为第一等技能资产,不仅描述“做什么”,更编码“看哪里、如何检查、怎样验证”,从而在需要空间对齐和视觉验证的 GUI、机器人等任务中,显著降低因文本模糊导致的失败率。
实验
实验设计
作者构建了 AutoVisualSkill 自动系统,将智能体在视觉任务中的执行轨迹转化为可复用的多模态技能。实验聚焦于 GUI 操作 及类似的 视觉中心任务,设计了三类技能形态:静态先验 (stable spatial conventions)、动态先验 (in-situ working memory) 和 交错视觉技能 (interleaved visual steps)。基线是纯文本技能(仅含指令、推理轨迹等)。评估围绕需要 空间对应、视觉证据 和 状态感知交互 的场景。
关键发现
视觉技能在所有任务上一致优于纯文本技能。
- 静态先验利用视觉参考图像消解了纯文本指令的空间模糊性,显著提升定位准确率。
- 动态先验通过生成当前状态的视觉快照,支持智能体进行 感知追踪,减少因状态遗忘导致的错误。
- 交错视觉技能将步骤文本与其对应的界面区域绑定,使智能体能理解“何处操作”而不仅仅是“做什么”。
实验同时揭示了纯文本技能的退化:当任务对视觉细节要求越高,文本描述的不足越明显。
与基线对比的深度解读
纯文本技能虽然易于存储和迁移,但面临 可视化知识丢失 的根本瓶颈。视觉技能将 空间布局、细粒度外观 和 局部状态变化 编码为可复用资产,这并非简单地在提示中加入截图,而是定义了文本与视觉的分工——文本负责逻辑,视觉负责空间。对比显示,即便使用强大的后端模型,纯文本方案在需要精确点击、计数或识别特定界面组件时仍频繁失败。视觉技能通过“看向哪里、检查什么、如何验证”的显式指引,弥补了这一缺陷,使智能体决策更贴近人类视觉常识。不过,论文也指出视觉技能存在过专化目标粒度、语义歧义等边界,因此需根据任务模态特征选择性应用。
行业影响
落地场景
Visual Skill 直接面向需要视觉理解与空间交互的自动化场景,为现有 AI Agent 注入可复用的多模态经验。典型落地包括:
- GUI 及 Web 自动化:跨应用界面测试、表单填写、数据抓取等,Agent 可保存并复用带截图锚点的操作序列,避免仅靠文本描述导致的界面变化误判。
- RPA(机器人流程自动化)升级:处理发票核对、医疗影像报告生成等依赖局部细节的任务,视觉技能提供空间参照与状态感知,提升复杂流程的鲁棒性。
- 电商与内容审核:商品图片合规检查、页面布局校验、内容推荐位监控等,通过静态先验定义标准布局,动态先验追踪局部变化,减少人工逐图审查。
商业价值
- 降本:自动将人类执行成功的任务轨迹转化为可复用技能,降低对专家手动编写脚本的依赖,并减少因界面微调导致的重写成本。
- 增收:在电商、金融等高频视觉任务中,自动化率提升直接加速业务流程,例如秒级完成批量商品主图合规检测,支撑更大规模运营。
- 体验提升:多模态技能让 Agent 在视觉任务中更稳定地定位目标区域,减少误操作与重试,对直接面向终端用户的虚拟助手、车载 HMI 交互等场景,可明显改善可靠性。
与现有产品 / 工作流的接口
Visual Skill 定位为 Agent 技能记忆模块,可集成到主流 Agent 框架中:
- 以 技能库插件 形式嵌入 LangChain、AutoGPT、CrewAI 等框架,Agent 在执行任务时根据视觉瓶颈触发检索对应技能。
- 提供标准化 视觉技能 artifact(JSON + 标注框 + 截图切片),现有 RPA 工具(如 UiPath、Playwright)可直接解析并重放锚点操作。
- 与多模态 LLM(GPT-4o、Gemini)配合使用,文本逻辑负责高层规划,视觉支持负责底层接地,形成可维护的层次化 Agent 系统。
具体用例
用例 1:电商商品体检自动化 某全球电商平台需每日检查数百万单品的主图是否符合规范(如是否有白边、价格标签位置)。利用 AutoVisualSkill,从人工审核的几次操作中自动生成带框选的视觉技能:静态先验存储正确布局模板,动态先验标注价格区域。Agent 后续运行只需比对模板并验证关键区域,将人工审核量降低 80% 以上,且能快速适配不同品类模板。
用例 2:保险理赔单据核验 保险公司处理大量扫描单据,需核实签名存在、印章位置、字段对齐等。纯文本规则难以描述复杂版面,引入 Visual Skill 将已核验的样本转化为交错视觉技能,Agent 可逐区域检查并给出判别依据。集成到现有 OCR 管道后,直通率提升 35%,争议单据回退减少,加速理赔周期。
局限
- 视觉技能的质量高度依赖任务轨迹中视觉参照物的准确提取,当交互界面发生显著风格或布局更新(如网页改版、OS 主题更换)时,所记录的静态先验(如按钮截图、区域坐标)可能快速失效;动态先验的生成也需要稳定的目标检测能力,在非标准控件或艺术化 UI 上容易出现匹配错误,限制了跨版本、跨应用的零样本泛化能力。
- 引入视觉信息增加了技能存储与检索的开销,尤其是在纯文本推理即可解决的任务中,附加的截图或区域标注反而可能分散注意力并增加 token 消耗;论文虽然提出了模态选择决策边界(6.4 节),但当前仍依赖启发式规则,缺乏自动化判别是否启用视觉技能的高效机制,导致实际部署中需要额外的人工调优。
- 实验验证仅覆盖 GUI 操作与视觉计数等有限任务,尚未在更复杂的 agent 场景(如三维环境导航、长周期任务规划)中评估视觉技能的有效性;此外,论文自身也讨论了更强多模态基模型可能弱化显式视觉协议需求的趋势(6.2 节),如果未来模型能够隐式地进行空间推理与状态追踪,当前视觉技能范式的必要性可能降低。