行业新闻

商汤开源轻量多模态模型SenseNova U1.5-Lite-Preview,支持4K图像生成

商汤开源轻量多模态模型U1.5-Lite-Preview,8B参数即可4K直出和复杂编辑,让AI生图贴近真实创作流程。

商汤向社区开源SenseNova U1.5-Lite-Preview,一个轻量级原生统一多模态模型,仅8B参数即可生成4K图像。它在高信息密度信息图、参考图复刻、局部编辑等任务中表现出色,能让用户通过自然语言和编辑指令完成复杂的视觉内容创作,接近一个可迭代的视觉工作台。

正文摘录

markdown 这个新发布的图像模型有点厉害:直接输出 4K、国产、开源! 我们从结果可以看到,即便是把图片放大来看,不论是文字还是图片元素,细节都保持得很完整。 它,便是商汤刚刚面向社区开源的 SenseNova U1.5-Lite-Preview。 这是一个轻量级原生统一多模态模型的早期预览版本。所谓“原生统一多模态”,指的是将语言、视觉语义和像素生成放进同一套模型里进行建模,而不是把独立的模块拼装起来。它延续了商汤自研的 NEO-Unify 架构,覆盖视觉理解、推理、生成与编辑。 在仅有 8B-MoT 参数(8B 表示 80 亿参数左右,MoT 是 Mixture-of-Transformers,一种基于 Transformer 的混合架构)的轻量身形之下,U1.5-Lite-Preview 做到了: 毕竟在真实创作中,“会画图”只是第一步,真正决定它能不能进入创作流程的,还得看复杂任务和编辑能力。 那 U1.5-Lite-Preview 这个 8B-MoT 小模型创作起来有多方便?我们继续往下看。 画面正中央,是一台被拆解开的复古相机。镜头、快门、胶片仓、卷片轴、取景器等结构,被一层层摊开来讲清楚;一束橙色光线从镜头前方打进来,顺着成像路径一路穿过去,整张图的视觉中心也因此一下子立住了。 这种图最难的地方,其实并不在于“画一台相机”本身。真正难的是,模型得同时把时间线、知识模块、结构拆解、流程说明和视觉层级都组织进同一张图里,还得让人一眼看过去,知道哪里是主干、哪里是补充、哪里是说明、哪里是结论。 从最后出来的效果看,U1.5-Lite-Preview 在这种高信息密度的信息图任务上,已经能把内容和版式一起接住。黑白蚀刻风格很统一,主视觉够醒目,细节也足够丰富,整张图读起来并不乱,反而有种“越看越有东西”的感觉。

阅读原文(qbitai.com)→

行业新闻十三2026-08-03原文

相关内容