行业新闻

紫东太初提出GMC核心集剪枝,减少80%视觉Token保持多模态能力

GMC通过群体互补信息传输压缩视觉Token,减量80%仍保持多模态性能,无需重新训练,可即插即用。

多模态模型处理图像时会产生大量视觉Token(图像块编码),占用显存、拖慢推理。紫东太初团队提出GMC剪枝方法,不采用传统高分筛选,而是将未选中Token的信息合并到代表Token上,无需微调即可减少80%以上Token,性能几乎不降,还能减少幻觉。

正文摘录

- title: 紫东太初推出GMC核心集剪枝方法,少 80% Token 仍满血保真多模态能力 - sourcecompany: 量子位 - bodymarkdown: 随着视觉语言模型分辨率与图文理解能力持续升级,图像会被编码为数百至上万个视觉 Token。 大量 Token 持续参与解码计算、长期占用 KV Cache,带来 显存开销大、推理速度慢、部署成本高 等一系列问题,视觉 Token 冗余已成为多模态模型高效推理与规模化落地的核心瓶颈。 当前行业通用方案为传统 Top-K Token 筛选:对每个 Token 独立打分,仅保留得分最高的部分样本。 但该方法存在明显缺陷:高分 Token 高度集中在画面显著区域,反复保留同质化冗余信息,极易遗漏文字、数字、坐标轴、目标空间关系等分散但关键的互补证据; 同时低分 Token 被直接删除,携带细节信息永久丢失,导致模型推理失真、事实判断偏差、视觉幻觉增多,普遍存在「压缩必掉精度」的行业难题。 针对以上痛点,中国科学院自动化研究所紫东太初大模型团队,提出 核心集剪枝方法 GMC(Grounded Message Coreset Pruning),实现了技术跨越式创新。 GMC 彻底跳出「筛选单个最优 Token」的传统思路,基于模型真实推理逻辑,认为视觉语言模型依赖的是全体 Token 构成的 集体消息,而非孤立图像块。因此压缩不仅要确定「信息保留位置」,更要解决「保留 Token 的信息承载方式」。 GMC 整体分为 互补证据自适应筛选 与 群体互补信息传输 两大核心阶段,在不训练、无额外模型依赖的前提下,实现高保真、高效率的视觉序列压缩。 其次,根据视觉特征之间的相似性保护图像中的不同外观结构,避免模型只关注当前已经被问题激活的内容;

阅读原文(qbitai.com)→

行业新闻思邈2026-08-12原文

相关内容