EVA01: 基于混合Transformer的统一原生3D理解与生成
本文针对多模态大语言模型(MLLMs)中原生集成3D网格的挑战,提出EVA01统一框架。现有方法存在两大问题:1)基于扩散的大规模重建模型将语义理解与几何推理解耦,依赖密集2D像素先验,本质上是无状态的重建器;2)基于MLLM的方法将3D模态作为外部输出而非原生组件,仅做增量适配,未系统性分析几何流形与MLLM特征空间的对齐。 EVA01基于混合Transformer(Mixture-of-Transformers, MoT)架构,将模型解耦为预训练的理解专家(E{und})和结构镜像的生成专家(E{gen}),通过共享全局自注意力与硬模态路由耦合。该设计对齐MLLM骨干的语义潜在空间与几何流形,直接转移多模态先验,无需中间2D表示。 实验表明,EVA01在原生文本到3D生成任务上达到最先进保真度,并解锁了长上下文多轮几何编辑能力,可保持身份一致性——这一能力是无状态重建管线无法实现的。此外,研究为将2D基础模型与3D任务集成提供了架构启示,指导3D原生多模态系统的设计。
论文精读
TL;DR EVA01 首次将 3D 网格作为原生模态融入 MLLM,采用 Mixture-of-Transformers 解耦理解与生成,实现高质量文本到 3D 生成及身份保持的多轮上下文编辑。
问题
问题背景
多模态大语言模型(MLLM)正加速吸纳文本、图像、音频之外的新模态,3D 内容生成成为下一个关键战场。业界关注如何将 3D 网格 作为一等公民直接融入模型,实现从“描述即生成”到“理解后编辑”的闭环交互,而不仅限于一次性重建。
现有方法局限
现有方案主要分两路,各自存在结构性短板:
- 扩散式重建模型(如 Score Distillation Sampling、多视图重建)将语义理解与几何推理完全解耦,依赖密集的 2D 像素先验,形成无状态的重建器。它们无法对已生成形状进行语义级别的持续编辑,且因缺乏 3D 原生潜空间,难以实现多轮上下文交互。
- MLLM 外部挂载方案 把 3D 输出视为额外的 token 序列或嵌入,并未真正将网格几何结构与语言特征空间对齐,导致几何流形与语义潜空间割裂,理解能力薄弱,生成质量受限。两者都未系统分析如何将非欧几何信息融入 Transformer 表征。
技术挑战与重要性
3D 网格的非欧结构和离散拓扑使其与 MLLM 中平坦的 token 空间存在本质差异。难点在于:
- 表征对齐:如何让语义潜空间(理解)与几何流形(生成)共享同一套特征基,使文本条件可直接驱动网格变形,而不依赖 2D 折中。
- 架构解耦:MLLM 主干需能同时处理多模态序列和理解/生成双任务,且避免互相干扰,这要求对注意力机制进行模态路由设计。
- 状态保持:实现多轮几何编辑需要模型记住历史上下文并保持物体身份一致性,传统无状态重建器无法做到。
工业界与学术界正竞相构建 3D 原生多模态系统,成功后可能颠覆 3D 资产生产流程,并催生 3D 虚拟助手等新应用。
行业类比
这好比从 文本到图像扩散模型 到 文本到 3D 生成 的进化,但需要从“无状态画师”升级为“可对话、能改稿的 3D 设计师”,其核心是将 3D 几何真正内化为模型的母语。
核心洞察
- **原生3D网格作为一级模态** 打破了扩散重建模型将语义理解与几何推理解耦的局限。以往方法要么依赖2D像素先验进行无状态重建,要么在MLLM中将3D作为外部输出,缺乏对几何流形与LLM特征空间对齐的系统分析。EVA01通过双专家架构和共享全局自注意力,让语义潜在空间直接映射到几何流形,无需中间2D表示,从而实现了更连贯的文本到3D生成和更精准的语义保真度。
- **长上下文多轮几何编辑** 是EVA01解锁的关键新能力,它让模型在多次交互中追踪并保持3D物体的身份一致性。这与无状态重建管道有本质差异:后者每次生成都是独立的,无法引用历史状态。EVA01的生成专家通过硬模态路由共享理解专家的上下文,使模型能够理解“把这个椅子腿变短”这样的连续指令,并维持零件间关系,为交互式3D创作提供了端到端可微的解决方案。
方法
架构概述
EVA01 是一个基于 Mixture-of-Transformers (MoT) 的统一框架,将 3D mesh 原生整合为多模态大语言模型 (MLLM) 的一等公民,同时支持理解、生成与上下文敏感的几何编辑。
输入与模态表示
- 文本经 tokenizer 转换为标准 token 序列。
- 3D mesh 通过专门的几何编码器离散化为 mesh tokens,投射到与文本 token 共享的语义空间,无需中间 2D 渲染。
关键模块:双专家解耦
模型主体拆分为两个结构镜像的 Transformer 专家:
- Understanding Expert (
E_und): 继承预训练 MLLM 的语义骨干,负责多模态理解与上下文分析。 - Generation Expert (
E_gen): 专司 3D 几何生成,与E_und共享全局自注意力层,但通过 硬模态路由 (hard modality routing) 控制信息流,避免模态间干扰。
信息流与生成机制
- 输入序列(文本 + 可选参考 mesh tokens)送入
E_und,产生富含语义的隐变量。 - 在生成阶段,
E_gen透过共享的 全局自注意力 (shared global self-attention) 直接读取E_und的语义条件,自回归解码 mesh tokens。 - 该设计使得 语义潜在空间与几何流形在注意力机制内对齐,省去传统方法中以 2D 图像为中间代理的步骤。
训练策略
采用 多阶段课程学习 (multi-stage curriculum learning):先用大规模静态 3D 资产预训练 mesh token 生成能力,再引入编辑标注数据进行上下文感知的微调,逐步提升多轮编辑的身份保持能力。
与同类方法的差异
与基于扩散的 3D 重建(如 SDS)相比,EVA01 将 3D 作为原生生成目标,避免了 2D 投影带来的语义‑几何解耦;与仅把 3D 作为外部输出插件的 MLLM 不同,EVA01 在架构层将 3D 模态融入注意力机制,实现理解与生成一体化,并天然支持长上下文多轮编辑,这是无状态重建管线无法达成的能力。
实验
实验设计
EVA01 的实验围绕 原生 3D 网格理解生成与编辑 展开,划分四个维度:
- 单轮生成:评估文本到 3D 网格的生成质量,对比扩散重建方法。
- 网格理解:测试模型对 3D 拓扑、语义属性的识别与问答能力。
- 多轮上下文编辑:验证在保持身份一致性的前提下,通过多轮对话逐步修改几何结构的能力——这是无状态重建管线无法实现的场景。
- 表征分析:通过可视化语义潜空间与几何流形的对齐程度,解释模型如何传递多模态先验。
实验采用标准 3D 指标(如 Chamfer Distance、FID 3D 变体),并引入 主观评价 衡量编辑一致性与指令遵循度。消融研究重点分析硬模态路由、Mixture-of-Transformers 解耦、全局自注意力共享等设计的贡献。
关键发现与基线对比
- 原生文本到 3D 生成保真度达到 SOTA,超越了依赖中间 2D 表示(如多视图图像)的扩散重建方法,因为 EVA01 直接在 MLLM 的特征空间中预测几何,避免了语义-几何解耦导致的细节丢失。
- 多轮编辑能力是定性突破:传统方法每次重建均为无状态过程,无法保持物体身份;EVA01 通过共享自注意力将历史编辑上下文编码到同一个几何流形中,使编辑指令能持续累积。
- 表征分析表明,理解专家与生成专家的 语义-几何潜空间对齐 是迁移能力的关键,消融实验中关闭共享自注意力会导致生成质量显著下降,证明了注意力耦合的必要性。
- 与最近 MLLM 方法相比,EVA01 不把 3D 作为外部输出,而是作为模态序列的原生组成,因此在几何理解任务上具有更高的指令跟随准确性。
行业影响
落地场景
EVA01 将 3D mesh 直接作为多模态大语言模型(MLLM)的原生模态,支持文本到 3D 生成、3D 理解和多轮上下文编辑。这为需要 3D 内容的产品打开了大门:
- 电商与展示:根据商品文本描述直接生成高保真 3D 模型,替代传统手工建模或扫描,大幅缩短上架周期;可对已有模型进行多轮语义编辑(如“将椅子靠背加高 5cm,材质改为橡木”),支持交互式定制。
- 游戏与影视:快速生成 3D 资产(角色、道具),并通过多轮编辑实现迭代修改,保持身份一致性(如调整角色铠甲而不改变面部特征),提升前期制作效率。
- 教育仿真:根据教学内容自动生成 3D 解剖模型、机械零件等,并支持上下文修改,用于构建虚拟实训环境。
商业价值
- 降本:传统 3D 建模依赖专业美术,成本高、周期长。EVA01 的端到端生成能力可减少人力依赖,单次生成成本趋近于 API 调用费用,对于需要大量 3D 资产的电商、游戏厂商是显著的边际成本下降。
- 增收:通过支持实时 3D 定制(如在线家具配置器),提升用户参与度和转化率;广告行业可快速生成动态 3D 创意素材,提高投放效率。
- 体验提升:将静态的商品详情页升级为可交互 3D 预览,配合多轮编辑实现“所见即所得”的个性化配置,缩短决策链路。
与现有产品/工作流的接口
EVA01 基于 Mixture-of-Transformers(MoT) 架构,将模型解耦为理解专家(E_und)和生成专家(E_gen),并通过共享全局自注意力与硬模态路由进行耦合。该设计可直接嵌入现有 MLLM 管线:
- 已部署的 2D 基础模型(如视觉语言模型)可作为理解专家直接复用,接入 EVA01 的生成分支,无需从零训练。
- 生成专家输出可直接对接游戏引擎(如 Unity、Unreal)或 WebGL 查看器,通过标准 3D 格式(OBJ/glTF)交付。
- 支持多轮交互的特性使其可集成到对话式 AI 界面(如客服机器人、设计助手),用户通过自然语言指令即可完成迭代修改,与现有 RAG 或 Agent 框架衔接。
具体落地案例
- 电商家具定制平台:用户输入“一张中世纪风格的橡木书桌,带两个抽屉”,EVA01 生成基础模型;接着用户说“抽屉换成黄铜把手,桌腿缩短 10cm”,系统在保持原桌体特征的前提下完成局部修改,并输出可直接用于 AR 预览的 3D 文件。全程无需设计师介入,缩短从需求到上架的时间,支持实时个性化。
- 游戏资产管线:独立游戏工作室利用 EVA01 快速生成 NPC 角色 3D 模型,然后通过多轮编辑批量产出变体(如更换武器、服装),保持角色整体风格一致,大幅减少外包成本,同时允许策划直接参与设计迭代,降低沟通成本。
局限
- **架构解耦与硬路由的刚性**:EVA01 将模型拆分为 Understanding Expert 与 Generation Expert,通过**硬模态路由**(hard modality routing)分配计算路径。这种设计虽有利于任务专业化,但牺牲了跨阶段信息流动的灵活性——例如,理解阶段产生的语义歧义无法直接利用生成能力进行消歧,可能影响复杂指令下的生成一致性。同时,双专家结构增加了参数总量与训练成本,推理时需维护两套计算子图,对实时应用场景不够友好。此外,硬路由的决策边界一旦固定,难以适应开放式对话中模态切换的动态需求,未来可能需要引入软路由或门控机制以提升灵活性。
- **基础模型依赖与3D数据瓶颈**:生成专家 E_gen 在结构上镜像于基于预训练的 Understanding Expert,其性能高度受制于 backbone MLLM 的语义理解质量。若基础模型在空间推理、物理常识等方面存在短板,会直接传导至 3D 生成结果,产生几何不合理或违背物理的 mesh。训练过程依赖从静态资产到上下文编辑的大规模 3D 数据,但高质量带标注的 3D 模型数量远逊于 2D 图像,尤其缺乏多样化、可复现的编辑序列数据。这可能导致模型在开放类别生成上的泛化能力不足,且在细粒度几何编辑(如局部变形、拓扑修改)时缺乏足够监督信号,保真度与 editability 之间存在隐式权衡。
- **多轮编辑的鲁棒性边界**:尽管 EVA01 在长上下文多轮几何编辑中展示了身份保持能力,但现有实验可能仅限于中等复杂度的刚体变换或结构保留型编辑。在面对大角度旋转、非刚性形变或语义矛盾指令(如“使其更轻”但保持原体积)时,模型是否仍能稳定保持几何一致性尚待验证。此外,多轮对话中的累积误差可能随时间步增长,尤其是共享全局自注意力在长序列下可能稀释早期上下文信息,导致后期编辑偏离初始意图。论文未详细分析最大有效轮次或编辑链长度极限,这在交互式设计场景中构成潜在风险。