论文

GenClaw: 代码驱动的代理式图像生成

GenClaw: 代码驱动的代理式图像生成

图像生成模型已从文本条件的像素合成,演变为具备视觉理解和工具调用能力的多模态代理。然而,现有代理仍受制于底层黑盒图像模型,其工作流程陷入重复改写提示词以优化生成的循环,缺乏直接操控画布的机制。本质上,大语言模型(LLMs) 作为真正“画笔”进行精确视觉构建的潜力仍未充分开发。 本文提出 GenClaw,一种 代码驱动的代理式图像生成范式,赋予代理像人类艺术家一样的创作能力:概念化、草绘,最后 着色。具体而言,代理首先通过搜索与推理构建概念知识和上下文;然后利用代码(如 SVG、HTML、Three.js)渲染可执行的视觉草图;最后使用图像生成模型补充纹理、材质与真实感。在此流程中,代码作为可控的中间画布,桥接语言推理与像素合成,将程序逻辑与生成模型的视觉表现力无缝整合。 通过将图像生成从黑盒范式转变为类似真实人类创作的阶段性过程,GenClaw 朝着高度可控且可解释的视觉生成系统迈出关键一步。

论文精读

TL;DR GenClaw 让 LLM 通过代码(SVG/HTML 等)直接操控图像画布,将生成拆解为概念化、草图、着色的类人创作流程,突破纯提示词迭代的局限,实现高度可控的图像合成。

问题

领域现状

当前图像生成正从单纯文本到像素的映射,转向融合视觉理解与工具调用的多模态智能体。业界关注的焦点是:如何让系统像人类创作者一样,通过构思、草稿、精细化上色等阶段,精确控制生成结果。

现有方法的局限

现有图像生成智能体(如基于 GPT-4V 或扩散模型后处理的方案)仍严重依赖黑盒生成模型。其工作流陷于 “提示词改写”的死循环:当结果不符合意图时,只能反复重写文本提示再次生成,缺乏对画布的直接操控。这种范式存在三大硬伤:

  • 空间与结构控制弱:文本难以精确描述物体的位置、大小、遮挡关系,无法保证组合一致性。
  • 迭代效率低下:每一轮重试完全重新生成像素,无中间可编辑的草图层,浪费算力。
  • 可解释性与可复用性差:生成过程不留下可追溯的结构化表达,难以局部修编或复用到多风格变体。

为什么这个问题既难又重要

核心挑战在于语言推理与像素合成之间存在巨大的表示鸿沟。自然语言连续而模糊,像素空间则要求精确的几何与语义约束。理想的智能体需要一种既能让 LLM 编写和操控,又能映射为视觉图形的中间表示。代码(如 SVGHTML/Three.js)天然具有这种潜力,但如何保障代码生成的可执行性、与后期生成模型的纹理补充无缝衔接,是技术难点。

从产品角度看,广告海报生成、交互式角色设计、物理仿真可视化等场景急需高可控、可迭代的生成范式。黑盒生成模式下,设计师只能靠反复试错满足商业需求;而引入代码草图后,非艺术家也能通过自然语言指令调整布局、颜色和风格,这使“专业级视觉构造”向更广泛的开发者开放。

行业类比

就像程序合成领域从“自动补全黑盒代码”演进到 GitHub Copilot 式的结构化交互编程,GenClaw 通过引入代码驱动的可执行草图,把图像生成从一次性黑盒魔法变成了渐进式可视构造过程。

核心洞察

  • GenClaw将代码作为可控的中间画布,使得智能体能够以结构化方式构建图像,而不仅仅是重写文本提示。传统图像生成代理只能通过优化提示词间接影响输出,无法精确控制空间布局和几何结构。GenClaw引入代码(SVG/HTML/Three.js)作为可执行草图,使智能体直接定义对象的形状、位置和关系,再结合生成模型添加纹理和真实感。这从根本上将图像生成从黑盒调参转变为分阶段创作,显著提升了可解释性和可控性。
  • GenClaw将推理与执行结合,通过搜索和代码生成实现概念知识的物理化,超越了纯视觉生成模型的能力。与仅依赖图像模型内部知识不同,GenClaw的智能体可从互联网检索信息,并通过代码生成可执行的可视化推理(如物理模拟),从而产生更符合现实世界的图像。这弥补了生成模型在常识推理和事实一致性上的不足,为知识密集型的视觉生成任务(如科学插图、数据可视化)提供了新范式。

方法

整体框架:从概念到照片的创作式流水线

GenClaw 将图像生成分解为三阶段,对应三个处理层:认知结构化层可执行画布层视觉生成与审查层。整个流水线模拟人类艺术家的创作行为:先构建知识图谱与视觉规划,再利用代码绘制可执行草图,最后注入纹理和真实感细节。

输入与认知结构化

用户提供自然语言意图后,认知结构化层通过搜索与推理将意图转化为结构化蓝图。该层不仅解析关键词,还从外部知识库检索上下文(如物体属性、空间关系、风格参考),构建概念知识图谱,并输出包含布局、比例、颜色等约束的视觉规划。这一步骤将模糊指令转化为明确构图,为后续精确控制奠定基础。

可执行画布层:代码作为中间表示

与传统代理依赖黑盒模型反复改写提示不同,GenClaw 引入可执行代码(SVGHTMLThree.js 等)作为“可控中间画布”。LLM 根据结构化规划生成程序代码,精确控制每个视觉元素的几何形状、位置、层次和视觉属性。代码渲染后直接呈现为矢量草图或 3D 场景基线,例如用 SVG 描绘排版布局,用 Three.js 构建物理仿真骨架。这种程序化逻辑将生成过程从概率采样转变为确定性构造,避免生成模型的结构扭曲。

视觉生成与审查:从草图到照片级合成

可执行画布的输出(渲染图像或深度/布局图)作为条件注入下游生成模型(如扩散模型)。生成模型在已有结构约束下补充纹理、材质、光照等细节,实现照片级真实感。强先验(如精确边缘、深度线索)确保生成结果忠实于原始几何布局,仅允许在质感与光影上自由发挥。审查层随后评估一致性,对不符合规划的局部区域触发重绘或调整,形成闭环优化。

与同类方法的差异

相比以文本为中心的语言代理(如基于 ChatGPT 的 DALL·E 3 工作流),GenClaw 以可执行代码替代提示重写作为核心操控手段,使代理能直接“绘制”而非仅“描述”,将黑盒式采样转化为阶段式可控工程。这一转换显著提升了对组合性、空间关系和文本渲染的精准控制力。

实验

实验设计

GenClaw 的实验围绕其三阶段流水线(认知结构化、可执行画布、视觉生成与审查)的可控性与可解释性展开,重点考察在需要精确空间布局、文本渲染、物理常识与事实知识的场景下,代码驱动的中间表示是否能带来增益。评测覆盖以下维度:

  • 组合控制:检验可执行结构对物体位置、关系、数量的约束能力,与传统文本到图像模型及纯 prompt 改写 agent 对比。
  • 文本渲染与海报生成:在含有文字、版面编辑的任务上,对比纯像素生成与 SVG/HTML 驱动的生成质量。
  • 物理模拟:将 Three.js 等作为视觉推理介质,评估 agent 对物理常识的建模与图像生成模型的后端承接效果。
  • 图像编辑:在 ImgEdit 基准上,考察基于代码的局部编辑相较于全局重绘的灵活性与保真度。
  • 知识 grounding:在 Mind-Bench 上衡量搜索推理与代码构图结合后的事实一致性。

关键发现

  • 可执行结构显著增强组合控制:代码作为中间画布,使 LLM 能以几何约束(如 SVG 坐标、CSS 布局)精确指定对象位置与数量,避免了黑盒扩散模型常见的属性混淆与物体丢失。
  • 文本渲染质量飞跃:相比直接让图像模型生成文字,HTML/SVG 渲染后再由生成模型补充材质与光照,文本清晰度与拼写准确率大幅提升。
  • 物理模拟成为新视觉推理范式:通过 Three.js 构建可执行物理场景,agent 可将常识推理结果转化为可量化的视觉输出,再经图像模型增加真实感。
  • ImgEdit 上的编辑灵活性:代码驱动的编辑支持对象增删改和属性调整,且保留无关区域的一致性,优于 end-to-end 指令编辑方法。
  • 知识 grounding 收益明显:搜索增强的认知结构化层降低了事实错误,代码执行的可见性便于用户验证信息准确度。

与基线的深度对比

与当前依赖黑盒图像模型且仅循环改写 prompt 的 agent 相比,GenClaw 的最大差异在于将 LLM 从“文案修改者”升级为“画布操控者”。这一转变在需要精细空间推理的任务上(如“左红球右蓝立方体,中间放大理石纹理的字母 A”)尤为关键:传统 agent 只能反复描述,而 GenClaw 通过 SVG 直接定义每个元素的坐标与样式,生成结果首次即满足多数约束。然而,工作流的高可控性也带来对底层生成模型纹理/光影质量的强依赖,且在简单任务上额外代码生成步骤会引入延迟——这也成为未来需优化的方向。

行业影响

落地场景

GenClaw 的代码驱动代理范式为需要精确布局控制文本渲染的图像生成场景提供了直接工具。典型落地包括:

  • 电商产品图生成:自动合成带促销文案、多商品组合、精确尺寸标注的展示图。
  • 广告与海报创作:品牌素材 + 动态文本,通过 SVG/HTML 控制字体、排版,再注入视觉风格。
  • UI/UX 原型设计:从需求描述生成带交互结构的界面草图,并补充真实感材质。
  • 游戏资产生成:利用 Three.js 构建 3D 场景骨架,再由扩散模型细化纹理与光照。

商业价值

  • 降本:将传统“提示词反复试错”的黑箱流程转为可编程、可复用的代码画布,减少人力反复调整,提升素材产出效率。
  • 体验提升:代码中间层天然携带可解释的结构信息,支持后续编辑、局部修改与品牌约束,输出质量更稳定。
  • 增收窗口:内容平台可提供模板化 + AI 上色的增值服务,例如自动生成符合品牌规范的营销图,缩短上线周期。

与现有产品/工作流的接口

GenClaw 可无缝嵌入现有 AI 设计工具链:

  1. LLM 推理层:由 GPT-4 等大模型生成 SVG/HTML/Three.js 草图代码。
  2. 图像生成 API:将代码渲染为位图,调用 Stable Diffusion 或 Midjourney 风格化填充。
  3. 协作工具集成:输出为 Figma/Adobe XD 可解析的层级文件,或直接对接 CMS/电商后台自动发布。

具体落地用例

  • 电商平台:输入“黑色简约手表,表盘显示 12:30,下方小字‘限时优惠 30%’”,GenClaw 先生成 SVG 排版确保文字清晰、位置准确,再用模型补充金属质感与光照。结果可直接嵌入商品详情页,无需设计师二次加工。
  • 在线教育内容生产:根据课程标题生成信息图式摘要卡片,通过 HTML 代码控制图表比例与文字层级,再风格化渲染,批量产出课件配图。

局限

  • **高度依赖底层生成模型**:GenClaw 将代码草图作为可执行中间表示,但最终的纹理补充与真实感渲染仍依赖现有的图像生成模型。若底层模型在复杂结构理解、纹理连贯性或长文本渲染上存在短板,整体输出质量会受到严重制约。这种 dependency 意味着框架的进步不完全自主,其上限仍被黑盒生成器所限定。
  • **效率开销与收益递减**:工作流包含认知构建、代码生成执行、视觉生成及审查等多阶段,引入了较单阶段文本到图像生成额外的计算开销。在简单场景或不需要严格结构控制的用例中,多步推理与代码渲染的回报可能不足,存在 diminishing returns,影响实际部署的成本效益。
  • **代码生成稳定性风险**:通过 LLM 动态生成 SVG、HTML 等代码来构建草图,可能因模型幻觉、语法错误或逻辑偏差导致渲染失败或结构错位。这种不确定性增加了 agent 过程的调试负担,并在自动化流程中需要额外的错误处理与重试机制,降低了系统的鲁棒性与实时性。
论文Junyan Ye2026-05-28原文

相关内容