BrowserBC开源项目:将人类浏览器操作蒸馏为可复用Agent技能
BrowserBC把人类在浏览器上的操作轨迹变成可复用的技能卡,让Agent不再重复试错,大幅提升任务成功率。
Agent在浏览器上常因探索而低效。BrowserBC将人类的一次完整操作录制成自然语言技能卡,明确“做什么、怎么算完成”,然后让小模型照做。实验显示可提升成功率20个百分点以上,且技能可跨模型迁移。
正文摘录
BrowserBC:克隆人类点击,让一次网页操作转化为所有 Agent 的能力 - 来源公司:量子位 Agent 从来不是不会用浏览器,只是浪费太多时间在探索——BrowserBC 把人类轨迹蒸馏成可复用的 Skill 来完成 Behavior Cloning,用户点一遍,Agent 照着就能跑通。 Claude、Codex 这类 Agent 能看页面、能识别按钮和输入框,能点击、输入、跳转、提交。 每接一个新任务、每换一个新网站,几乎都要让最强、也最贵的那个模型,从零开始再把整个流程摸索一遍。 陷进 死循环,在几个页面之间反复横跳;慢慢 偏离最初的任务意图,越走越远;在搜索结果里来回切换却始终没读全;或者明明已经很接近答案,却提前收手、草草交差。 在摸索一遍之后呢?就算这次侥幸做成了,这点经验也往往随着这一轮对话一起蒸发。下一次同类任务,再换一个 Agent,还要从头试错、再踩一遍同样的坑。 更具体一点——能不能让人把任务认真做一遍,把这一遍操作里的「门道」打包下来,然后交给一个更便宜、更小的模型,让它照着做,就能完成同一类任务? Einsia AI 旗下 Navers Lab 发布的开源项目 BrowserBC 给出的答案,是一条三步范式:录制→转写成 Skill→交付执行。 传统的按键精灵,会把人的鼠标点击和键盘敲击录下来再回放——但它录的是写死的坐标和按键,页面一变、布局一动,整段脚本立刻就废了。 BrowserBC 录的不是坐标,而是把这一遍操作 转写成一份讲清「该做什么、怎么算做完」的技能: 它能被另一个模型读懂,能在变了样的页面上举一反三,也能被不断合并、复用——它是那种会「理解」、能迁移、还能直接交给别人用的按键精灵。 这也揭示出 BrowserBC 的核心—— 技能从哪里来,和技能由谁来执行,可以彻底分开。