动态

DiffThinker:扩散模型实现视觉空间推理新范式

Yafu Li
我们提出了 DiffThinker,一种基于扩散模型的生成式多模态推理新范式。不同于依赖文本中心思维链的方式,DiffThinker 将推理重新构想为原生图像到图像的生成过程。这一转变实现了:• 在长程视觉任务中更高的逻辑一致性和空间精度 • 可控且稳定的推理成本 • 对多个候选解的原生并行推理 • 与 MLLM 的有效协作,性能优于任何单独模型。扩散模型可以直接在视觉空间中进行推理。
AK
DiffThinker
迈向基于扩散模型的生成式多模态推理
https://t.co/I6UX31w56I
动态Yafu Li2026-01-05原文

相关内容