openJiuwen发布多模态Skill范式Skill-Omni,让Agent复用视觉经验
openJiuwen发布全球首个工程化多模态Skill范式,让Agent能从网页和视频中提取视觉经验并复用,突破纯文本Skill的局限。
Agent的Skill长期困在纯文本里,处理修图、界面操作等“看了才明白”的任务时总差一口气。openJiuwen新发布的Skill-Omni能自动从网页和视频中提取关键截图与操作脉络,生成Agent可复用的多模态Skill,让Agent不仅读得懂、还看得见执行依据。
正文摘录
让 Skill “有图可依”:openJiuwen 首发多模态 Skill 范式 Skill-Omni Skill 让 Agent 不必每次都从零开始摸索,而是可以复用已有的任务经验,但一个明显的短板始终存在: 今天写给 Agent 的 Skill 几乎全是 纯文本,修图该修到什么程度、界面上该点哪个按钮,这些 “看了才明白” 的知识,一直塞不进一份 Markdown 文档。 针对这一问题,openJiuwen 社区正式发布 Skill-Omni —— 业界最早工程化落地的多模态 Skill 范式。 它让 Agent 的经验从 “读得懂” 升级为 “看得见”,把网页和视频中的视觉知识,沉淀为 Agent 可复用的多模态 Skill。 具体来说,用户只需提供一个网页链接或一个 B 站视频链接,JiuwenSwarm 中开箱即用的 skill-omni-creation 就会自动提取其中的关键截图、界面状态和操作脉络, 生成 Agent 可直接读取复用的多模态 Skill。 这也是继 SwarmSkill、SwarmFlow 之后,openJiuwen 在 Skill 工程化方向上的又一次快速迭代。 这在代码生成、文档处理等任务中足够有用;可一旦 Agent 开始处理视觉任务、GUI 任务,局限立刻显现—— 有些任务,本来就不是 “说清楚” 的,而是 “看明白” 的。 人类也许能领会,但对 Agent 来说过于模糊:主体在哪里?柔和到什么程度?有没有参考效果? 这些问题仅靠文字很难给出稳定答案。 真正的知识藏在调整前后的视觉差异里:有了前后对比图,Agent 才能看到 “调整到什么程度才算合理” 。 但 “设置” 可能是齿轮图标,也可能藏在头像菜单下;“高级选项” 可能需要滚动页面才能看到;“导出配置” 可能是按钮,也可能是下拉菜单里的某个条目,界面里还有多个相似按钮。