行业新闻

阿里清华合作论文获ICML杰出论文奖 揭示扩散模型“灵活性陷阱”

扩散模型任意顺序生成在推理中因绕过难点而表现更差,强制从左到右生成效果更好,简单方法击败所有复杂算法。

扩散语言模型(可任意顺序生成文本)被寄予厚望,但阿里清华研究发现,在推理任务中,这种灵活性反而导致模型绕过逻辑难点,性能下降。他们用“JustGRPO”方法强制从左到右生成,在GSM8K上达到89.1%准确率,超越所有专为扩散模型设计的复杂强化学习算法。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/d4df3f84-77bd-46c9-a084-57f89081ddce/%E5%9B%BE%E7%89%871(2).png) 7月5日,阿里巴巴与清华大学合作的论文 The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models(灵活性陷阱:重新审视扩散语言模型中任意顺序生成的价值)入选 AI 顶会 ICML 杰出论文(Outstanding Paper)。杰出论文是 ICML 最高荣誉,代表当年最具影响力的研究工作,通常只授予 2-3 篇,获奖率仅占接受论文的千分之一。 ![](https://image.jiqizhixin.com/uploads/editor/d97e3a86-7644-499a-9b46-39b783e18fa4/%E5%9B%BE%E7%89%871.png) 图说:2026 年 7 月 5 日,ICML 2026 主席团公布两篇杰出论文名单,阿里巴巴与清华大学合作的论文入选。 dLLM(扩散大语言模型)是当前最受关注的下一代语言模型架构之一,Google 的 Gemini Diffusion、中国人民大学的 LLaDA 等都属于这一方向。主流大语言模型(LLM)如 GPT、Qwen 等生成文本就像打字,从左往右逐个生成 token。与 LLM 不同,dLLM 在生成文本时可以任意选择生成顺序,无需从左往右,理论上拥有更大的生成解空间,在近一两年被寄予厚望。但这篇论文首次提出质疑:在解决数学、编程等通用推理任务时,任意顺序生成非但不能提升模型能力,反而会成为陷阱。

阅读原文(jiqizhixin.com)→

行业新闻新闻资讯2026-07-06原文

相关内容