港大等提出 SceneMosaic:一张图生成可仿真的多样 3D 房间布局
用「马赛克拼片」的思路把 3D 房间拆成可独立替换的局部单元,SceneMosaic 在保持物理合理性的同时把布局生成提速 24 倍。
机器人训练依赖仿真环境,但现有方法要么慢(单场景生成 7.56 小时),要么物理错误多(碰撞率 20%26%),且一个输入只给一个固定布局。香港大学等团队提出 SceneMosaic,把场景拆成可独立演化的「局部单元」,先做计算与物理修正再由智能体微调,生成一个变体场景仅需 0.03 小时,碰撞率为 0。
正文摘录
.jpg)  机器人要想真正走进普通家庭,训练和评测就不能一直受制于现实世界的数据采集效率。仿真环境因此成了绕不开的一环。但现有仿真环境大多家具稀疏、陈设单调,而真实房间恰恰是又挤又乱,物体相互支撑、遮挡。 目前有两条主线可以批量的生成这种房间,一条是 智能体 来通过文本生成场景,一条是通过 参数化的方式通过图片来生成场景。 但是这两条主流路线都撞了墙。 智能体文生 3D 让视觉语言模型(VLM)像室内设计师那样反复提出物体、摆放、检查、再调整,能产出高质量、物理上站得住脚的场景,代价是慢:SAGE 在实验中生成单个场景耗时 7.56 小时,比人工手动摆一遍还慢。 参数化图生 3D 把场景构建拆成「逐物体资产生成 + 6D 位姿估计」,借助真实图像自带的布局先验,十几分钟就能还原整个场景,代价是不准:直接回归的位姿经常物理上站不住,经常产生椅子悬空、书本穿模进隔板的现象,碰撞率高达 20%26%。 还有一个问题,是两条路线都没有真正解决的 :不够「活」。 现有方法对一个输入只给一个确定性布局。但真实房间会随着人的活动不断变化,比如椅子被拉开、书被换到别的位置,整体功能和物理关系却依然成立。