行业新闻

CoLT提出三步潜思维链推理 加速多模态大模型20余倍

CoLT用三个潜向量替代数百文本token,让多模态模型推理加速20倍以上,精度反而提升。

多模态大模型推理时,传统思维链需逐token生成数百文本,效率低且误差易累积。CoLT将思考过程压缩为3个连续向量(潜思维),用外部解码器和内部步间预测监督训练,在MMStar等基准上实现22.6倍文本解码加速、10.1倍端到端加速,平均准确率提升3.4%,且无需额外视觉标注。

正文摘录

[图片](https://image.jiqizhixin.com/uploads/article/coverimage/0019c73e-23f4-41ba-8345-15a84a072150/0-2026-07-14T181848(2).638.jpg) [图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 一、研究背景:当 CoT 遇上「慢」与「窄」 近年来,多模态大语言模型(MLLM)在视觉问答、图表理解、科学推理等任务上取得了令人瞩目的进展。Qwen3-VL、InternVL3、Step3-VL 等模型不断刷新开源榜单,而支撑其复杂推理能力的关键技术之一,正是 Chain-of-Thought(CoT,思维链) :让模型在给出最终答案之前,先以自然语言逐步展开中间推理过程。 从 Wei 等人提出的 CoT 提示,到 DeepSeek-R1、OpenAI o1 所代表的 长链推理范式,「先想后答」 已成为构建高智能多模态系统的标准协议。 然而,文本 CoT 在带来性能增益的同时,也暴露出三个难以回避的结构性瓶颈。 - 推理效率 :每一步思维都必须以离散 token 自回归生成,一次完整推理往往消耗数百甚至上千个 token,构成推理阶段最主要的计算负担。 - 表达局限 :一旦将连续的思考过程「坍缩」为某一条具体的自然语言表述,模型便失去了在多种解题路径间保持分布的能力。 - 错误传播 :早期推理步骤中的偏差会沿链条逐级放大,在长链场景下尤为致命。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-15原文

相关内容