行业新闻

阿里清华论文揭示扩散语言模型任意顺序生成陷阱,极简方案JustGRPO刷新推理纪录

阿里清华ICML杰出论文发现扩散语言模型任意顺序生成是推理陷阱,简单回归从左到右训练即可大幅提升性能。

阿里巴巴与清华大学合作的论文获ICML杰出论文(千分之一获奖率),提出“灵活性陷阱”理论:扩散语言模型(可任意顺序生成文本)在数学、代码等推理任务中会绕过难点,损害性能。团队提出JustGRPO——放弃任意顺序,强制从左到右生成并用GRPO强化学习,在GSM8K上达到89.1%,全面超越所有复杂算法。

正文摘录

7月5日,阿里巴巴与清华大学合作的论文 The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models(灵活性陷阱:重新审视扩散语言模型中任意顺序生成的价值)入选 AI 顶会 ICML 杰出论文(Outstanding Paper),杰出论文是 ICML 最高荣誉,代表当年最具影响力的研究工作,通常只授予 2-3 篇,获奖率仅占接受论文的千分之一。 图说:2026年7月5日,ICML 2026 主席团公布两篇杰出论文名单,阿里巴巴与清华大学合作的论文入选。 dLLM(扩散大语言模型)是当前最受关注的下一代语言模型架构之一,Google 的 Gemini Diffusion、中国人民大学的 LLaDA 等都属于这一方向。主流大语言模型(LLM)如 GPT、Qwen 等生成文本就像打字,从左往右逐个生成 token,与 LLM 不同,dLLM 在生成文本时可以任意选择生成顺序,无需从左往右,理论上拥有更大的生成解空间,在近一两年被寄予厚望。但这篇论文首次提出质疑:在解决数学、编程等通用推理任务时,任意顺序生成非但不能提升模型能力,反而会成为陷阱。 研究发现,不确定性高的关键逻辑节点(如“因此”“所以”),像是一个分叉口。若采用从左向右的顺序,模型必须在此处当场作出选择,生成下一个 token,不能跳过。若采用任意选择生成顺序,模型会倾向于绕过这些难点,优先处理容易的部分。等回头再填充这些节点时,前后文已经确立,原本的推理分叉口变成了填空题——答案被上下文锁定了。 图说:从左向右的自回归顺序(a)迫使模型在每个逻辑分叉口做出选择;任意顺序(b)绕过难点,优先处理容易部分,导致推理路径被提前锁死。

阅读原文(qbitai.com)→

行业新闻量子位的朋友们2026-07-06原文

相关内容