行业新闻

扩散语言模型新方法T:渐进扩块避免大块推理退化

上海科学智能研究院等提出T,通过渐进式扩块强化学习,解决了大块扩散语言模型推理不稳的问题。

扩散语言模型用更大生成块提升并行度,但数学推理变差。T通过“先小后大”课程,先在B=4小步学习再逐步扩到B=32,在4B模型MATH500上从60.73提升到76.00。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/3030ac5b-5b97-4eba-8c50-d7ed9e878ce3/022(2).jpg) ![图片](https://mmbiz.qpic.cn/mmbizjpg/5L8bhP5dIqFg0WfYlyqqeepLD4C3TibGpjf6FOH7EVuKjibcnDe74qjAU9XhgHylI3WghS7ricbx1ckkNhJHaQ2AnGqG5ZmOdwHJQLl99bxYHU/640?wxfmt=webp&from=appmsgimgIndex=0) 本文第一作者夏翰宸为上海科学智能研究院研究员,主要研究方向有 Agentic RL 和多模态扩散语言模型。共同一作是上海科学智能研究院主任研究员陈保友,通讯作者是复旦大学教授、上海科学智能研究院 AI 科学家、上海创智学院全时导师朱思语。 扩散语言模型(一种非自回归生成模型)想用更大的生成块换取更高并行度,却常常先丢掉数学推理,直接在大块模型上做强化训练甚至会出现训练崩塌。 本文中,来自上海科学智能研究院等机构的研究者提出 T,给出一套「 先小后大」的课程:先在小块上学稳去噪轨迹,再逐级扩展到 B=8、16、32。4B 模型在 B=8 的 MATH500 设置下,相较原始 SDAR checkpoint 从 60.73 提升到 76.00。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-05原文

相关内容