商汤发布 U1 Pro 与 SenseNova-Vision,推进多模态统一基座
商汤发布 U1 Pro 和 SenseNova-Vision,分别实现长程视觉创作闭环和经典视觉任务统一生成,推动多模态基座架构换代。
商汤在 WAIC 发布两款模型:U1 Pro 基于 NEO-unify 架构,将理解、生成、编辑、行动统一,支持长程创作闭环;SenseNova-Vision 将检测、分割等经典视觉任务转化为多模态生成问题,并开源 5000 万样本数据集。两者标志多模态基座从拼接走向原生统一。
正文摘录
.jpg) 编辑|杜伟 刚刚结束的 2026 年世界人工智能大会(WAIC),具身智能与 AI 终端占据了最显眼的位置,人形机器人、灵巧手和各类智能硬件吸引了大量目光。 展台上的热闹之外,模型架构的演进构成了大会的另一条技术线。 在备受关注的多模态模型领域,行业长期陷入「搭积木」式的困境:理解、生成、编辑和行动往往分散在不同的专家模块中。这种拼接架构带来了严重的「信息衰减」 —— 任务链越长,信息传递时的损耗和误差就越大,最终演变成「听懂了但画不对」、「改了局部破坏全局」的行业痛点。 这类架构问题被摆上了台面,业界急需新的解题思路。 近日,商汤科技在 WAIC 2026 发布了日日新 SenseNova U1 Pro(以下简称 U1 Pro),这款面向长程任务的交付级原生多模态智能体基座模型,将理解、生成和行动纳入统一的能力框架。 而在 WAIC 召开前夕,商汤还开源了日日新 SenseNova-Vision 视觉大模型,将目标检测、图像分割、深度预测和三维重建等经典计算机视觉任务,直接沉淀为通用大模型的原生能力。 这连续两次出手,并非孤立的技术发布。如果说 U1 Pro 代表了商汤在「上层复杂视觉创作与交付」上的原生突破,那么 SenseNova-Vision 则回答了「底层物理世界感知与几何物理表达」如何统一进通用大模型的终极命题。两者的交汇,标志着商汤已率先卡位下一代原生统一多模态基座。