Architect-Ant:可编辑的建筑平面图自动家具布置
房地产可视化、室内设计与建筑工作流都需要已布置家具的平面图,但自动家具布置面临两大挑战:真实世界数据有限,且需满足相互作用的几何与功能约束。本文探究能否用预训练模型从真实平面图中学习专业布置知识,从而无需昂贵的迭代式 agentic inference 直接生成约束感知布局。 作者提出 AntPlan 数据集与 Architect-Ant 框架。AntPlan 含 505 张真实专业建筑平面图,覆盖 92 个物体类别与十类住宅房间的密集家具标注;Architect-Ant 以可编辑的基于坐标的 DSL 表示布局,先经监督微调学习专业布置模式,再用 GRPO 与 Layout Rule Score (LRS) 优化,LRS 聚合专业平面图中的几何与功能约束,提供结果层面的监督而无需预设推理轨迹。 实验显示,相比多种 state-of-the-art 基线,Architect-Ant 兼具低几何违规率与高功能完整性,定性结果更贴近真实住宅布置模式;所得布局保持对象级可编辑,并可转换为 3D 场景。
论文精读
TL;DR Architect-Ant 利用 505 套真实户型数据集 AntPlan 训练视觉语言模型,以可编辑坐标 DSL 直接生成家具布局,并通过 GRPO 优化 Layout Rule Score,在低几何违规下达到高功能完整性,省去昂贵迭代推理。
问题
问题背景:自动家具布局(Automatic Furnishing)是房地产可视化、室内设计与建筑工作流中的关键环节,负责将无家具的平面图转换为带家具的可视化场景,直接影响方案沟通与设计迭代效率。
现有方法局限: 传统规则/优化方法依赖手工定义几何与功能约束,难以覆盖多样住宅布局和复杂家具组合,泛化能力弱。基于生成模型或强化学习的方法受限于真实专业平面图数据稀缺,常在合成数据上训练,导致布局缺乏专业合理性。近期 agentic 迭代推理框架通过多步“生成—校验—修正”降低违规率,但计算成本高、推理链不可控,且难以直接输出结构化可编辑结果。深度生成模型对家具间交互约束(通行空间、开门范围、功能分区)缺乏显式建模,常产生碰撞或功能不合理布局。
为什么难/重要: 核心挑战在于几何约束(碰撞、包含、可达性)与功能约束(房间类型对应家具配置、朝向与功能关系)相互耦合,不同房间类别差异大,需要从专业图纸中隐式学习这些模式。真实数据获取与标注成本极高,505 个专业平面图已属稀缺资源。业界对快速、低成本、可编辑的布局生成有持续需求,尤其在工作流中要求输出对象级表示而非静态渲染图,以融入后续 3D 管线。
行业类比: 类似文本到 SQL 生成:将自然语言映射到可执行 DSL,再利用执行反馈做偏好优化,以提升生成结果的语义正确性与可编辑性。
核心洞察
- 将家具布局表示为可编辑的坐标 DSL,使模型直接输出结构化、对象级可编辑的布局,并能无缝转换为 3D 场景。这不同于生成图像或 dense mask 的方法,避免了后期矢量化和语义提取的困难,保留了交互式编辑能力,更适合实际建筑与室内设计工作流。通过 SFT 学习专业分布,模型生成符合真实习惯的布置,而非仅满足碰撞约束。
- 使用 Layout Rule Score 作为 outcome-level 奖励,结合 GRPO 进行优化,无需人工设计推理链或过程监督,让模型从最终布局的几何与功能评分中学会隐式推理。这区别于依赖 agentic 迭代搜索或显式 trace 监督的基线,显著降低了推理成本,同时实验表明其几何违规率低、功能完整度高,证明 outcome supervision 可以有效地迁移专业布局知识。
- 构建 AntPlan 数据集,从 505 个真实专业建筑平面图中提取 92 类家具的密集标注,覆盖 10 类住宅房间,填补了真实世界自动布置数据稀缺的空白。相比常用合成数据或稀疏标注,该数据集保留了专业设计师的布局模式与约束交互,为训练和评估提供了更真实的基准,使模型能学习到可泛化的功能安排而非简单填充。
方法
方法概览
Architect-Ant 以真实建筑平面图为输入,包括房间壳(墙体、门、窗位置)、房间类别(如卧室、客厅)及家具类别白名单。
关键模块 按处理流程如下:
- 可编辑布局表示:采用基于坐标的 DSL,每个家具实例表示为类别、位置、旋转角度和尺寸,支持逐物体编辑,避免位图或网格不可修改的局限。
- 监督微调(SFT):在 AntPlan 数据集(含 505 张专业平面图、92 类家具、10 类房间)上训练模型,学习从房间条件到布局 DSL 的映射,捕捉专业布置模式。
- 约束感知优化(GRPO):定义 Layout Rule Score (LRS),聚合几何约束(碰撞检测、房间包含、家具可达性)与功能约束(物体配对、功能区域覆盖),作为奖励信号进行 GRPO 式偏好优化,只监督最终布局结果,不要求预定义推理链。
- 候选选择与 3D 渲染:生成多个候选布局,根据 LRS 与视觉偏好评分筛选,输出对象级可编辑家具布局,可进一步转换为 3D 场景用于可视化。
输出 为坐标级家具布局,保持房间功能完整性与几何合理性。
与依赖迭代 agentic 推理或生成式图像模型的同类方法相比,Architect-Ant 通过单次前向生成结合偏好优化,直接产出约束感知且可编辑的布局,计算开销更低且结果可精确调整。
实验
实验设计上,论文在 AntPlan 数据集(505 张真实专业住宅平面图)上开展评估,对比多种 state-of-the-art 基线方法。评测覆盖几何违规率、功能完整性、密度、覆盖率、Layout Rule Score (LRS) 以及基于 VLM 的视觉偏好,同时进行 SFT 与 GRPO 的消融实验。
关键发现:Architect-Ant 在降低几何违规率的同时获得较高功能完整性,定性结果更符合真实住宅布置模式。优化后的布局保持对象级可编辑,并能转换为 3D 场景。GRPO 以 LRS 为奖励信号,仅提供结果级监督,无需预设推理轨迹,避免了高成本迭代 agentic 推理。
与基线对比:多数基线依赖迭代式 agentic 推理或模板约束,Architect-Ant 通过预训练模型直接学习专业布置知识,生成速度更快且无需外部规划器。可比基线的优势在于可编辑 DSL 表示与结果级奖励结合,使模型在满足几何 / 功能约束的同时更贴近人类偏好。
行业影响
落地场景
Architect-Ant 可嵌入房地产展示、在线室内设计、家具电商与建筑 BIM 工作流。例如,房产平台对空置房源做 虚拟 staging,自动生成带家具的平面图和 3D 视图;家具电商在用户上传户型后实时推荐并摆放商品;设计软件提供 自动布局初稿 供设计师微调。
商业价值
核心是降低人工布置成本并加速迭代。传统人工布置一张户型图需数小时,Architect-Ant 可在秒级生成多套合规布局,用于 A/B 测试或批量房源处理,边际成本几乎为零。其 可编辑 DSL 保留对象级操作,避免黑盒输出,设计师可直接修改坐标、类别,提升交付效率。此外,约束满足(碰撞、可达性)减少返工,改善最终用户体验。
与现有产品/工作流的接口
模型输出为坐标 DSL,可无缝转换为 JSON/XML,集成到 AutoCAD、Revit、Blender、Unity 等工具。通过 REST API 或本地推理服务,前端调用生成布局,后端返回结构化数据,再渲染为 2D/3D。与 LLM 代理方案相比,Architect-Ant 单次前向推理,无需多轮 agentic 搜索,更易于嵌入实时交互产品。
具体 use case:
- 某国际家具电商平台集成 Architect-Ant,用户上传房间照片或户型图,系统自动摆放该平台在售家具,生成“搭配建议”并直接链接购物车,提升转化率。
- 某房地产 SaaS 工具批量对数千套空置房源生成带家具的平面效果图,用于线上 listing 展示,替代人工摄影或 3D 建模外包,降低 staging 成本。
局限
- 数据规模与多样性限制。AntPlan 虽含 505 个真实专业平面图,但相比大规模视觉语言模型预训练数据仍较小,且家具布局风格受限于收集来源,可能难以泛化到不同建筑规范、户型格局或非常规房间形状;92 个对象类虽覆盖常见住宅,但对商业、办公等场景覆盖不足。论文在摘要中也承认 automatic furnishing 受 limited real-world data 挑战,该数据集规模可能不足以捕捉长尾家具组合与复杂空间关系。
- 约束建模与评估替代性。LRS 通过聚合几何与功能约束提供 outcome-level reward,但这些规则源自对专业平面图的归纳,难以覆盖所有实际可用性、人体工学和美学因素;实验以 VLM-based visual preference 作为视觉质量评估,虽然比传统 IoU 更灵活,但 VLM 判断未必等同于专业设计师或住户的真实偏好,缺乏严格的人类专家研究。因此生成布局可能在规则分数下表现良好,但实际可用性仍待验证。
- 推理成本与实时性。Architect-Ant 使用 GRPO 和候选选择,需要生成多个布局候选并计算 LRS,相比单步生成方法增加了推理延迟和计算开销;文中虽提及 room-specific generation budgets 及 candidate selection,但未系统分析不同预算下的效率-质量 trade-off,也未给出与实时交互或大规模批量生产场景的对比。若部署到需要即时反馈的交互式设计工具,可能需要额外的蒸馏或缓存策略。