商汤开源 SenseNova U1.5-Lite-Preview,8B 规模实现 4K 多模态生成与编辑
商汤开源新一代统一多模态模型,在8B小模型上实现4K图像生成与精准编辑,验证了架构的可扩展性。
商汤科技开源了轻量级统一多模态模型 SenseNova U1.5-Lite-Preview。它在同一架构中处理语言理解、视觉推理与图像生成,以 8B 参数(80亿参数)即可生成 4K 图像,并支持长文本指令的精准编辑,适合海报、信息图等复杂创作。
正文摘录
.png) 今年 4 月,商汤科技发布了 SenseNova U1,首次完整展示了基于 NEO-Unify 架构的原生统一多模态路线:在单一模型中联合建模语言、视觉语义与像素生成,让模型能够原生完成视觉理解、推理和生成。 过去几个月中,我们持续强化模型的图像生成与编辑能力,现面向社区开源轻量级统一多模态模型的预览版本 SenseNova U1.5-Lite-Preview。SenseNova U1.5-Lite-Preview 并非简单的模型规模升级,而是基于 U1 的一次系统性迭代,不仅 在同一架构中贯通视觉理解、推理、生成与编辑 ,还 仅以 8B-MoT 的轻量大小 ,将能力推进到 4K 、更精细的真实质感、更复杂的视觉控制和可持续迭代编辑。  SenseNova U1.5-Lite-Preview 生成 相比 U1,U1.5-Lite-Preview 在以下方向上带来了显著提升: - 原生支持 4K 图像生成; - 更精细的局部纹理、细节与真实世界质感; - 更准确的中英文文字生成与复杂版式组织; - 更稳定的图像编辑和视觉指令遵循。