行业新闻

商汤开源 8B 模型 SenseNova U1.5 Lite

商汤开源 8B 统一多模态模型,用“先拆开练再合回来”的策略,在图像编辑与复杂排版上实现接近闭源模型的性能。

商汤科技正式开源 SenseNova U1.5 Lite,一个仅 8B 参数的多模态模型。它能将九张比例、背景各异的图片整齐合成一张,精准识别每道菜品并适当美化;也能通过“框选+标注”精准修改局部,同时保持床、柜体等非编辑区域不变。在复杂排版与精准编辑等核心场景上,该模型可比肩闭源 GPT-Image-2。

正文摘录

开源国产 8B 模型,比肩闭源 Image 2 了! 原本各自拍摄、比例和背景都不一样的九张图片,一下子就被整整齐齐地设计到了一张图里;并且 AI 还精准识别出了每道菜品,同时还给它们适当加了美化处理,让图片整体变得更加养眼。 我们在原图的基础上,用 "框选+标注" 的方式,把想要修改的图片局部细节给标了出来: 可以明显看到,几个目标区域都按照要求发生了变化,但床、床头柜、玻璃杯、右侧柜体,包括整个卧室原来的空间关系都基本保留下来。 而这个 AI,便是 商汤科技 这次正式开源的 SenseNova U1.5 Lite ,其亮点如下: - 8B 参数规模,轻量级部署 - 原生统一多模态架构,理解、生成、编辑一体化 - 复杂排版与精准编辑能力,比肩闭源 GPT-Image-2 而且啊,SenseNova U1.5 Lite 依旧保持了 8B 的大小,还能在复杂排版与精准编辑等核心的场景上比肩闭源的 GPT-Image-2: 如果说三周前的 SenseNova U1.5 Lite Preview 版本是验证一个统一模型能够把视觉能力扩展到哪里。 那么到了今天的正式版本,商汤科技则是进一步验证这些能力能否分别得到强化,再重新统一到一个轻量级模型中,并稳定进入真实创作流程。 复杂信息图:六阶段流程一图呈现 要在一张竖版信息图里,需要同时塞进 Harvesting、Fermentation、Roasting、Grinding、Tempering 到 Finished Chocolate 六个阶段。 每个阶段既有文字解释,也有对应的可可果、发酵箱、烘焙设备、研磨装置、巧克力浆等视觉元素,而且六层内容还得顺着版式一路往下走。 从最终的效果来看,SenseNova U1.5 Lite 已经做到了可以 组织一整套视觉表达 ,包括长文本、多层级结构、插画、数字顺序和版式关系。

阅读原文(qbitai.com)→

行业新闻十三2026-08-25原文

相关内容