SenseNova-U1.5:迈向原生统一视觉智能
我们发布 SenseNova-U1.5,一个 8B-MoT 原生统一多模态模型,可在无编码器、无 VAE 的架构内理解、推理并生成视觉内容。 方法层面,我们通过空间连贯的 patch 重建强化其视觉接口,并借助精心筛选的生成与编辑数据、改进的任务形式化、结构化 prompt 增强以及最高 4K 的原生分辨率来扩展训练规模。在后训练阶段,我们针对视觉美学、双语文字渲染、信息图生成与图像编辑优化专用专家,并通过多专家 on-policy distillation 整合其能力。 实验层面,在广泛评测中,SenseNova-U1.5 大幅提升了图像保真度、文字渲染、复杂构图、多参考编辑与交错生成,同时改善指令遵循,并保持主体身份、几何结构与未修改区域的一致性。 结论层面,尽管其生成数据中结构化格式的曝光有限,模型仍能有效泛化到长程、复杂且结构化的视觉指令,进一步证明多模态理解可迁移至视觉规划与创作。这些发现表明,原生统一建模是通往在完全端到端框架内感知、推理与创造的系统的一条有前景路径。我们将开源训练代码,包括监督微调、强化学习与 on-policy distillation。
论文精读
TL;DR SenseNova-U1.5 以 8B-MoT、无 encoder/VAE 的原生统一架构同时理解与生成视觉,并通过 patch 重建、多专家蒸馏实现高保真图像与复杂指令跟随。
问题
问题背景
视觉生成正从单一图像合成扩展为通用视觉创建,覆盖多语言排版、信息密集型设计、高分辨率渲染与多参考合成,业界对模型同时完成理解、推理与生成的需求日益迫切。
现有方法局限
主流方案依赖模块化架构,如视觉编码器 + 扩散解码器或 VQ-VAE,引入信息瓶颈且难以端到端优化;原生统一模型虽去除编码器/VAE,但早期版本受限于 patch 离散化带来的图像保真度不足、文本渲染差、复杂组合失败等问题,指令跟随能力弱,难以处理长而结构化的视觉指令。
为什么这个问题难且重要
统一模型需在离散 token 效率与连续特征保真之间权衡,多任务联合训练易发生冲突,且高质量生成/编辑数据构建成本高。若实现高保真、可控编辑与强指令跟随的原生统一架构,将简化训练/推理管线、提升泛化能力,是下一代理工智能视觉系统的关键路径。
行业类比
类似端到端自动驾驶从模块化感知-规划-控制转向单模型输出,原生统一视觉模型有望在创意设计、文档自动生成、多参考图像编辑等场景降低系统复杂度并增强鲁棒性。
核心洞察
- 原生统一架构摆脱编码器/VAE依赖,通过空间一致patch重建直接学习视觉token,使理解与生成共享同一表示空间。与主流“语言模型+外部视觉编码器/扩散潜空间”的混合架构相比,这种方式消除了模态对齐瓶颈和潜空间信息损失,在8B-MoT规模上实现端到端训练。工程上意味着减少模块间适配成本,提高生成保真度与指令一致性,为更紧凑的视觉智能系统提供可行路径。
- 多专家on-policy蒸馏将特定能力(美学、双语文本渲染、信息图生成、图像编辑)从专家策略整合到统一模型,不同于静态模型合并或简单数据混合。它通过在线策略采样和蒸馏使模型在保持通用理解的同时吸收专家行为,避免灾难性遗忘和风格漂移。这为复杂视觉生成任务的后训练提供了可扩展的对齐范式:用专家生成反馈信号再统一蒸馏,对多能力集成有很强的工程参考价值。
方法
输入与原生序列建模
SenseNova-U1.5 接收纯 token 序列作为输入,将文本指令、参考图像(可选)与待生成图像统一表示为离散 token,无独立视觉编码器与 VAE,图像通过空间连贯 patch 重建直接映射为 patch token。
关键模块与训练流程
- 8B-MoT 架构:在原生多模态 Transformer 中引入混合专家(Mixture-of-Tokens),各专家分别强化视觉美学、双语文本渲染、信息图生成、图像编辑等能力,提升容量同时保持推理效率。
- patch 重建预训练:以空间相干重建损失训练视觉接口,使模型在无 VAE 条件下直接预测图像 patch 序列,保持局部几何与全局一致性。
- 数据构建与任务表述:精心构造生成、编辑、交错数据集,改进任务模板,加入结构化 prompt 增强,支持最高 4K 原生分辨率的多尺度训练。
- 后训练与蒸馏:先对多个专家模型分别进行强化学习优化(基于奖励模型),再通过多专家 on-policy distillation 蒸馏到统一模型,实现在线策略下的能力整合。
输出与推理
模型根据指令自回归生成图像 patch token,经解码得到最终图像;同时可输出文本推理过程,实现理解、推理与生成的交织。
差异点
相比依赖预训练 VAE 或扩散模型的统一多模态方案,SenseNova-U1.5 移除编码器与 VAE,通过 patch 重建与专家蒸馏构建完全端到端的原生视觉智能框架。
实验
实验设计: SenseNova-U1.5 的评估覆盖三条主线:图像生成(Qwen-Image-Bench、GenEval、DPG-Bench 等)、图像编辑(ImgEdit、GEdit-Bench、WeEdit 等)与交错生成(OpenING、VBVR-Pro-Bench、Uni-MMMU-GaU 等),同时包含通用理解基准。训练侧重空间连贯 patch 重建、4K 原生分辨率、多专家后训练及在线策略蒸馏,评测指标聚焦指令跟随、图像保真、文本渲染、主体一致性与未修改区域保持。
关键发现: 据论文摘要,模型在图像保真度、文本渲染、复杂构图、多参考编辑与交错生成上取得大幅提升,并保持主体身份、几何结构与未修改区域。尤其值得关注的是,尽管生成数据中结构化格式暴露有限,模型仍能泛化到长、复杂、结构化视觉指令,显示多模态理解可迁移至视觉规划与创作。工程上,去除 encoder/VAE 的原生统一架构减少信息瓶颈与级联误差;多专家在线策略蒸馏则提供一种整合专项能力(美学、双语文字、信息图、编辑)的路径,避免单模型微调带来的灾难性遗忘。
对比解读: 相比“理解编码器 + 扩散解码器”的混合架构,SenseNova-U1.5 的 encoder-free 与 VAE-free 设计简化了推理 pipeline,省去视觉 token 化与图像重建步骤,有望降低端到端 latency。与仅做 SFT 的统一模型相比,引入 RL 与 on-policy distillation 能更直接优化人类偏好与专用指标,但需更精细的 reward 设计与专家调度。4K 原生分辨率对信息图生成、文档级排版等场景价值明显,但可能显著增加训练与推理算力成本,后续应关注实际吞吐与性价比权衡。
行业影响
落地场景
SenseNova-U1.5 适合需要同时“看懂”与“画出”的视觉任务:电商产品图生成与多参考编辑、内容平台的信息图/海报自动生成、教育领域的图示化讲解、企业报告与数据可视化。原生统一架构免去独立视觉编码器和 VAE,单模型即可响应长而复杂的视觉指令,并支持交错的图文输出(interleaved generation),适合构建端到端的视觉 Agent。
商业价值
- 降本:替换原本“VLM 理解 + 扩散模型生成”的多步管线,减少模型部署与维护成本;8B-MoT 规模相对可控,可本地化推理。
- 体验提升:高保真、双语文本渲染、复杂构图与 4K 原生分辨率,能满足商业级视觉产出要求;指令遵循与身份保持能力增强,减少后续返工。
- 生态加速:开源训练代码(SFT / RL / on-policy distillation)降低二次开发门槛,企业可在自有数据上继续优化垂直能力。
与现有工作流集成
可作为多模态 Agent 的视觉核心,通过 API 或自托管方式接入。输入支持文本+多图像参考,输出支持单一图像或图文交错序列。在工程上,可将其封装为类似 generate_image(prompt, ref_images) 的工具函数,与 LangChain / LlamaIndex 等 Agent 框架、ComfyUI 节点或内部 MLOps 平台对接。对结构化视觉指令的泛化能力使其能直接消费 JSON 或 schema 化的任务描述。
具体 use case
- 电商:给定商品白底图和一张生活场景参考图,SenseNova-U1.5 可直接生成该商品在新场景中的高清营销图,保持商品 ID 与几何形状,无需额外抠图或合成步骤。
- 内容平台:输入文本指令“生成一篇关于 Q3 营收增长的信息图,包含柱状图和中文标题”,模型能输出排版合理、文字准确的可视化海报,适合自动配图或模板化内容生产。
局限
- **结构化格式暴露有限**:论文明确提到生成数据中结构化格式样本较少,模型对长、复杂、结构化视觉指令的泛化主要依赖多模态理解迁移,这可能导致在未见过的结构化布局或极端格式下生成细节不够稳定,例如复杂表格、多栏排版或精确对齐的文档风格图像。虽然评测显示泛化有效,但实际工程中若需高频生成结构化内容,仍需额外标注数据和针对性微调,这可能限制其在信息图表等垂直场景的开箱即用能力。
- **模型规模与效率权衡**:SenseNova-U1.5 采用 8B-MoT(Mixture-of-Tokens)架构,虽然相比稠密模型提升了推理效率,但多专家路由与训练时的负载均衡仍带来工程复杂度,例如专家容量设置、路由崩溃风险以及分布式训练中的通信开销。论文未报告与更大规模 unified 模型(如 >30B 或闭源模型)的直接对比,因此在复杂推理、细粒度视觉真实感(如人物手部、微小文字)上可能仍有差距,且 8B 参数量可能限制其在高分辨率 4K 生成时的细节保持能力。
- **训练与复现成本较高**:论文提出多专家 on-policy distillation 与强化学习流程,涉及多个专业专家(视觉美学、双语文字渲染、信息图生成、图像编辑)的独立训练和蒸馏融合,数据构造也包含大量 curated 生成、编辑、交错数据,整体训练链路复杂,对算力和数据工程要求高。虽然将开源训练代码,但复现完整流程仍需大量资源;此外,未明确报告训练总成本(GPU-hours)和失败尝试,可能削弱社区对该方法实际可行性的评估。