Autoregressive Mosaics: 探测文本-only语言模型中的2D空间推理能力
仅使用文本和代码训练的大语言模型(LLM)有时能生成绘制可识别图像的程序,但尚不清楚这是否反映了其内部存在2D空间布局表征,还是仅能完成将空间描述转化为代码。我们提出了 Autoregressive Mosaics(AM-Bench) 基准,以区分这两者: - 翻译任务:给定一张图片的完整几何文字描述,要求模型输出能生成该图片的代码。 - 布局任务:给出一条欠定的文字提示,要求模型构思并生成图像。 在八个开放权重的文本与代码模型中,所有模型都能可靠地将指定的几何信息转化为代码,但其开放式布局性能差异显著,表明这些差异无法仅用代码生成能力来解释。 进一步的输出介质消融实验表明,表达界面或介质会影响表现:将程序式代码替换为原始 SVG 后,所有模型的布局得分均有提升。通过激活探测发现,模型在生成前就开始构建大致的布局计划,但这仅反映提示词隐含的布局;生成过程中,模型追踪的是不断演变的几何状态,而非执行一个初始规划完成的方案。 整体来看,文本-only LLM 的2D空间性能既取决于模型本身,也依赖于输出介质,且不能仅用代码生成能力来解释。
论文精读
TL;DR AM-Bench 用翻译/布局双任务证明文本 LLM 的 2D 布局差异非代码能力所致,关键在输出介质(SVG)与动态几何状态追踪,模型非执行固定计划而是实时空间推理。
问题
问题背景:文本大语言模型在代码生成上表现优异,有时能生成绘制可识别图像的代码,引发对 2D 空间推理能力的关注。
现有方法局限:现有研究难以区分模型是内部形成 2D 空间布局表征,还是仅将空间描述机械翻译为代码。缺乏基准分离 翻译任务(给定完整几何规格生成代码)与 布局任务(从欠明确提示组合图像)。此前评估常混合代码生成与空间推理,导致模型差异无法归因。此外,输出介质(过程化代码 vs 原始 SVG)未被作为变量控制,可能影响公平性。
为什么难/重要:空间推理是通用智能关键组成,但纯文本模型无视觉输入,其能否通过文本训练习得 2D 空间表征是开放问题。理解这一点有助揭示模型内部机制,指导训练与推理优化。业界对多模态模型兴趣浓厚,但纯文本模型在代码生成、前端设计等场景仍广泛使用,其空间推理能力直接影响布局质量。技术挑战在于设计基准分离两种能力,以及用 激活探测 分析预生成阶段内部表征。论文发现模型生成前已有粗略布局计划,但生成时跟踪几何状态而非执行固定计划,凸显动态表征的复杂性。
行业类比:类似用语言模型生成网页布局或 SVG 图形,若模型缺乏空间推理,生成的界面元素可能错位,直接影响可用性与产品体验。
核心洞察
- 将 2D 空间推理拆分为**翻译任务**与**布局任务**,揭示了 text-only LLM 的代码生成能力与真正的空间布局能力是解耦的。以往研究常将模型能画出可识别图像归因于其理解了空间布局,但 AM-Bench 通过完全指定的几何翻译任务作为对照,证明所有模型都能可靠将文字几何转成代码,而开放式布局表现差异显著,说明代码生成只是必要条件而非充分条件,这为评估 text-only 模型的空间智能提供了更干净的范式。
- 输出介质(procedural code vs raw SVG)显著影响模型的空间布局表现,且该影响跨模型一致。这一发现挑战了“只要模型能生成正确代码,内部空间表征就固定不变”的假设,表明表达接口本身会引导模型在推理时采用不同的空间组织策略。对工程实践而言,选择更接近最终可视化形式的中间表示(如直接输出 SVG)可能比优化提示或模型更有效地提升空间任务表现。
- 探针实验显示,text-only LLM 在生成前已存在粗略布局计划,但该计划只是 prompt 中隐含几何信息的直接映射,并非模型内部自主形成的规划;生成过程中模型动态追踪逐步演化的几何状态,而非执行一个预先固定的计划。这与部分研究假设的“预先生成完整 latent plan 再解码”不同,说明空间推理在自回归生成中更接近增量状态更新,对设计空间推理增强方法(如注入几何约束或状态跟踪模块)有直接启发。
方法
方法概览
AM-Bench 通过两个互补任务分离文本模型的空间推理能力。
输入:
- 翻译任务 (translation task) 提供完整几何规格的文字描述,如“在 (10,20) 处画一个半径为 5 的红色圆”;
- 布局任务 (layout task) 仅给出欠定提示,如“画一个笑脸”,要求模型自行决定元素位置与尺寸。
关键模块:
- 画布生成:模型需编写程序(默认 procedural code,如 Python turtle 或类似 DSL)在固定尺寸画布上绘制图形;随后可通过替换输出介质为 raw SVG 进行消融。
- 评估体系:翻译任务采用符号化指标对比生成图形与目标几何的精确匹配;布局任务使用 VLM judge 从语义层面评分(如可识别性、布局合理性),并结合人类验证。
- 内部表征探测:对预生成阶段 (pre-generation) 的模型残差流进行线性探针训练,检测是否存在粗略布局计划;生成过程中逐 token 探测几何状态如何演化。
输出:生成图像对应的代码或 SVG 文件,以及各任务上的量化分数(翻译精度、布局质量)。
与同类方法(如仅评测代码生成能力或视觉推理基准)的差异在于:AM-Bench 显式解耦了“几何翻译”与“开放布局组合”,并通过输出介质消融和激活探测揭示文本模型中 2D 空间能力的双重来源——模型自身表征与表达介质的约束。
实验
实验设计
AM-Bench 通过两个任务分离 2D 空间推理能力:
- Translation Task:给定完整的几何文字描述,要求生成可绘制出该图形的代码,作为代码生成控制组。
- Layout Task:仅给欠指定提示,要求模型自主组合出可识别图像,直接考验开放布局能力。
评测覆盖 8 个开放权重纯文本/代码模型。另设输出媒介消融(对比 procedural code 与 raw SVG)和激活探针实验(生成前与生成中)。
关键发现
- 所有模型在 Translation Task 上均可靠完成几何到代码的转换。
- Layout Task 得分差异显著,说明差异不能仅由代码生成能力解释。
- 输出媒介消融显示:将
procedural code替换为raw SVG后,所有模型的布局得分均有提升。 - 激活探针表明:生成前存在粗略布局计划,但该计划只反映提示中隐含的布局;生成过程中模型在跟踪不断演变的几何状态,而非执行预先固定的计划。
与基线的对比解读
该工作直接挑战了“文本模型画图能力≈代码生成/几何翻译能力”的常见假设。通过分离 Translation Task 与 Layout Task,证明开放布局表现不能归因于单纯的代码生成水平。
作者论断:2D 空间表现同时取决于模型本身和输出媒介,与代码生成能力无单一对应关系。
工程启示:评估或使用此类模型做空间生成时,不应只关注代码准确率,还需考虑媒介选择(如 SVG 可能优于程序化代码);同时,模型并非预先生成完整静态蓝图,而是逐步推理几何状态,这提示解码策略与中间状态分析需要适配这种动态过程。
行业影响
落地场景
AM-Bench 表明文本 LLM 可生成可编辑的 2D 布局代码,且 raw SVG 输出显著优于 procedural code,可直接用于:
- 电商内容生成:输入商品特征与促销文案,自动产出商品卡 / 广告素材的 SVG 布局,前端渲染后供 A/B 测试或快速上架。
- 技术文档配图:从架构描述自动生成微服务拓扑图、数据流图初稿,嵌入在线教程或知识库。
商业价值
- 降本:省去初级设计排版人力,尤其批量生成同系列示意图(如商品活动页、课程插图)。
- 体验提升:内容平台可提供实时“文本转图”能力,创作者无需打开设计工具,提升创作效率与内容丰富度。
- 需注意:模型间布局能力差异大,且输出介质影响显著(raw SVG > procedural code),生产环境需选型评测并可能针对 SVG 微调。
与现有产品/工作流接口
- 管线前端:用文本 LLM 生成布局骨架(SVG/JSON),再交渲染引擎或扩散模型细化,避免纯图像模型的空间失真。
- 评测环节:将 AM-Bench 的布局评分集成到模型 CI,作为多模态能力回归指标。
- API 形态:提供
text→SVG接口,输出可直接被 React/Figma 插件消费,嵌入低代码平台或设计协作工具。
局限
- 论文评估范围局限于程序化图像生成(procedural drawing / raw SVG),未覆盖更自然的图像生成或通用视觉推理任务。模型均为开放权重文本-代码模型,未包括闭源模型(如 GPT-4o、Claude 3.5 等),因此结论外部有效性有限。实验中的图像分辨率较低,可能无法反映真实场景下空间推理的细粒度差异。
- 评估依赖 VLM judge(视觉语言模型)和 symbolic metric,VLM judge 自身可能带有空间推理偏差,且未与人类评价完全对齐(虽然论文做了 human-validation but limited)。另外,激活探测分析仅在特定层和生成阶段进行,不能全面揭示空间信息的内部编码机制。因果测试也仅探针对预生成阶段的粗略布局,后续演化状态未充分因果验证。
- 与前人工作相比,该 benchmark 专注于通过文本生成图像代码来评测空间推理,可能高估模型对空间关系的抽象理解,因为代码生成本身可以利用语法线索而非真正的空间认知。同时,缺乏与人类基线或更大规模多模态模型的系统对比,难以定位文本-only LLM 的独特缺陷在何处。