WebWorld: 浏览器作为世界模型,用于自我改进的 Web 代码
VLM 驱动的 Web 代码自改进存在结构性缺陷:提出修复的模型与评判修复的模型是同一个,视觉 plausibility 在评判者眼中只是页面真实可用性的微弱指征。循环中缺少一个 VLM 无法欺骗的对手方——而浏览器正是这样的对手方:它是一个确定性的、可执行的模拟器,能呈现 HTML 产物在用户操作下的行为,从任何意义上说都是 Web 代码的世界模型。 我们提出 WebWorld,该接口使得 VLM 能够自主地与浏览器即世界模型交互,并决定哪些交互会转化为监督信号。每一轮,VLM 生成批判意见,规划器将其编译为类型化的交互契约;浏览器重新执行候选方案,并且仅在目标进展与所有既有能力的保持都满足时签发验收证书。被认证的转换累积为一个质量棘轮,这是 SFT 导出端所能看到的全部。 在配对训练下,WebWorld-27B 在 HTMLBench-400 上较 Raw-27B 提升 5.3 个百分点,在 MiniAppBench-Val 上提升 14.9 个百分点,达到 Kimi-K2.6 与 GPT-5.4 等前沿系统在交互式 HTML 生成上的水平。等规模消融表明,浏览器背书的准入机制带来了上述增益:没有证书时,配对的 9B 模型提升几乎消失。
论文精读
TL;DR WebWorld 用浏览器作为可执行世界模型,通过交互合约与验收证书筛选 VLM 自提升的监督,避免“模型既当运动员又当裁判”,在 HTMLBench 与 MiniAppBench 上显著提升且逼近前沿模型。
问题
问题背景
当前,视觉语言模型(VLM) 在交互式网页代码生成与自改进中成为热点,从业者关注如何让模型在闭环中稳定提升生成质量。
现有方法局限
主流 VLM 自改进循环(如 self-refine)存在结构性缺陷:模型同时扮演“修复者”和“评判者”,其视觉合理性判断(visual plausibility)无法替代真实功能验证。具体问题包括:
- 自我评判偏差:修复模型与评判模型同源,难以发现自身盲点。
- 视觉合理性误导:页面渲染看起来正常,但交互逻辑(如点击、筛选、状态切换)可能失效。
- 无回归保护:新的修复可能破坏之前已验证的功能,旧方法缺乏保留约束。
这导致训练信号不可靠,模型可能在错误反馈下退化。
为什么这个问题难/重要
难点在于:交互式 HTML 的行为空间庞大且难以枚举,真实用户操作无法在训练时完全模拟;同时,自改进系统的可信度要求每一步验证都必须是确定性、可执行的,而非概率性评分。浏览器本身就是一个确定性的 HTML 执行模拟器,可充当不可欺骗的世界模型,但如何将其接入 VLM 的自主学习回路、并以可扩展的方式生成监督信号,此前缺乏系统设计。业界对这类可验证的自改进需求迫切,因为它直接影响自动化前端工程、低代码平台的可靠性。
行业类比
这类似于 强化学习 中从“自我奖励模型”转向“真实环境奖励”:只有外部可执行验证才能让智能体在长时间跨度下稳定提升,而不是被自身偏见所困。
核心洞察
- 浏览器是可执行的 Web 代码世界模型,提供了 VLM 无法欺骗的验证信号。现有自改进循环中模型既是修复者又是评判者,视觉合理性不可靠;WebWorld 利用浏览器确定性执行用户动作,基于真实行为而非视觉相似性判断页面是否工作,从而将自我评估转变为客观验证。这独特在无需额外训练世界模型,浏览器本身即为天然仿真器。
- 通过类型化交互契约和接受证书形成的质量棘轮,确保每次修复不仅达成目标且保留先前能力。VLM 的 critique 被编译为交互契约,浏览器验证目标进展和能力保持,只有两者都通过才颁发证书,认证的轨迹累积成质量棘轮,作为 SFT 唯一输入。这独特在结合了目标导向和回归防护,防止模型学会短期修复而破坏已有功能。
方法
输入:初始 VLM 策略(如 Raw-27B)与待改进的 HTML artifacts。
关键流程:
- Critic 生成:VLM 对当前候选页面提出 critique,指出功能缺陷或改进方向。
- 契约编译:planner 将 critique 转为
typed interaction contract,包含交互探针序列、预期状态变化及必须保留的既有能力。 - 浏览器执行验证:browser-as-world-model 确定性地重放交互,检查
target progress和preservation of previously verified capabilities。 - 证书颁发:仅在全部条件满足时,浏览器发出
acceptance certificate;否则拒绝该候选。 - 质量棘轮:只有带证书的 transition 被累积为
quality ratchet,作为监督信号。 - SFT 导出:仅用
quality ratchet中的认证轨迹进行监督微调,输出改进模型。
输出:经自我改进的 VLM(如 WebWorld-27B)。
与同类自改进方法(如 self-rewarding 或 self-critique)不同,WebWorld 用确定性浏览器作为不可欺骗的验证器,将生成与判断解耦,避免模型自我评判的幻觉偏差。
实验
实验设计
- 对比对象:WebWorld-27B 与 Raw-27B,在相同训练设置下进行比较。
- 评估数据集:HTMLBench-400、MiniAppBench-Val,覆盖交互式 HTML 生成能力。
- 消融机制:移除 acceptance certificate,考察 9B 规模下的性能变化,验证浏览器验证的贡献。
关键发现
- WebWorld-27B 在 HTMLBench-400 上提升 +5.3 点,在 MiniAppBench-Val 上提升 +14.9 点,均相对 Raw-27B 基线。
- 达到 Kimi-K2.6 和 GPT-5.4 级别的前沿系统水平,尤其在交互式 HTML 生成任务上。
- 消融实验显示:缺少 acceptance certificate 时,9B 模型的提升几乎消失,证明 browser-backed admission 是性能增长的核心因素。
基线对比解读
该方法与纯 VLM 自评判循环的根本差异在于引入浏览器作为确定性执行器,避免了“自评自修”的结构性偏差。quality ratchet 只让 SFT 导出经过认证的转移,过滤了视觉上合理但实际失效的修复。与 Raw-27B 相比,WebWorld 的收益来自验证机制而非模型规模,9B 消融结果直接支持这一结论:没有验证,模型自我改进信号的信噪比显著降低。
行业影响
落地场景
WebWorld 可用于 低代码/无代码前端平台、AI 辅助编程 IDE、自动化网页修复服务。它让模型生成的 HTML/CSS/JS 代码通过真实浏览器验证,适用于生成交互式网页、数据看板、营销落地页等场景。
具体案例:
- 电商:自动生成商品详情页的交互组件(如加购、筛选、弹窗),并用浏览器验证其功能正确性,减少上线前的 QA 人力。
- 内容平台:为文章/报告自动生成可交互图表或网页,WebWorld 验证交互逻辑后直接发布。
商业价值
核心价值在于 降本与体验提升:减少人工测试和修复成本,缩短从生成到上线的周期;同时提高生成代码的实际可用性,降低用户遇到坏页面的概率,提升产品体验。对于 AI 编程助手产品,这可以增强其输出可靠性,提升付费意愿和留存。
与现有工作流的接口
WebWorld 可以作为 独立验证服务 嵌入现有开发管线:接收模型生成的代码和测试用例,通过 浏览器自动执行 并返回 接受证书。它可以与现有代码生成模型(如 GPT-4、Claude)或内部模型通过 API 集成,也可作为 CI/CD 中的 质量关卡,只有通过验证的代码才能合并或交付。对于已有 SFT 训练流程,可将验证通过的轨迹作为训练数据,形成持续改进循环。
局限
- **依赖浏览器环境的保真度**:WebWorld 的有效性建立在浏览器作为确定性模拟器的假设上,但真实用户环境存在浏览器版本差异、设备性能、网络延迟、扩展插件等变量,当前的交互验证未必能覆盖这些分布外情况。论文在 HTMLBench-400 和 MiniAppBench-Val 上的评估可能高估了实际部署的鲁棒性,缺少跨浏览器或移动端的验证。
- **交互契约的质量受限于 VLM 批判能力**:规划器将 VLM 的 critique 编译为交互契约,若 critique 本身不准确或遗漏关键交互路径,契约设计可能偏颇,导致浏览器验证的监督信号有偏差。论文未系统分析 critique 失败对整体自改进循环的影响,也未与基于更强 VLM 的 critic 进行对比。
- **计算开销与可扩展性存疑**:每轮都需要浏览器重新执行候选页面并验证契约,可能带来较高的计算成本与延迟,尤其对于复杂交互或长轨迹。论文未报告完整的资源消耗(如 GPU 时、浏览器实例并发数),也未讨论如何将方法扩展到非 HTML/web 代码领域。