行业新闻

港中文等发布七模态数据集CUHK-X,专测VLM在非RGB模态感知

港中文等发布七模态数据集CUHK-X,专测VLM在非RGB模态感知

七模态数据集CUHK-X量化了VLM在热成像、深度等非RGB模态上的感知盲区,证明数据比参数规模更重要。

当前顶级VLM在RGB图像上表现优异,但在热成像、深度、毫米波雷达等真实场景常见模态上几乎失明。港中文联合UIUC等机构发布CUHK-X,包含64,267个七模态同步样本和三大基准六项任务,系统量化了这一能力断崖。评测发现,即便将模型参数堆到235B,在非RGB任务上表现依然不佳,说明数据匮乏才是根本瓶颈。

正文摘录

![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg73e422cdbc.png) 新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg3b253ef414-32.png) 【新智元导读】 当下的多模态大模型,在 Demo 里能对着照片侃侃而谈,可一旦离开 RGB 画面,面对热成像、深度、毫米波这些真实世界里随处可见的信号,就集体「失明」。港中文 AIoT 实验室联合 UIUC、哥伦比亚大学与匹兹堡大学,用一个包含 64,267 个七模态同步样本的数据集 CUHK-X,第一次系统地把这条「看得见却读不懂」的能力断崖量化了出来。最扎心的结论是,把模型参数堆到 235B,照样救不回来。该工作已被 ACM MobiSys 2026 录用。 过去两年,VLM (视觉语言模型)的进步几乎都写在 RGB 图像上。给它一张照片,它能描述、能问答、能推理,看上去无所不能。 但把它放进真实的居家、养老或医疗场景,故事立刻变了样。夜里光线不足、被家具遮挡、出于隐私不能上摄像头,这些恰恰是日常监测最常见的工况,也恰恰是 RGB 最不擅长的地方。真正要扛事的,是热成像、深度、毫米波雷达、IMU 这些非 RGB 模态。 问题在于,模型在这些模态上的表现,和它在 RGB 上的光鲜形成了刺眼的反差。根子也很清楚,训练和评测它们的数据长期是缺的。现有的人类活动识别 (HAR) 数据集绝大多数只给到粗粒度的 ⟨数据, 标签⟩,比如一条「跌倒」、一条「睡觉」,既没有连贯的语义描述,也不覆盖多模态。模型自然学不会「看懂」,更谈不上「读懂」。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-07-04原文

相关内容