扩散语言模型新方法T:渐进扩块避免大块推理退化
上海科学智能研究院等提出T,通过渐进式扩块强化学习,解决了大块扩散语言模型推理不稳的问题。
扩散语言模型用更大生成块提升并行度,但数学推理变差。T通过“先小后大”课程,先在B=4小步学习再逐步扩到B=32,在4B模型MATH500上从60.73提升到76.00。
正文摘录
.jpg)  本文第一作者夏翰宸为上海科学智能研究院研究员,主要研究方向有 Agentic RL 和多模态扩散语言模型。共同一作是上海科学智能研究院主任研究员陈保友,通讯作者是复旦大学教授、上海科学智能研究院 AI 科学家、上海创智学院全时导师朱思语。 扩散语言模型(一种非自回归生成模型)想用更大的生成块换取更高并行度,却常常先丢掉数学推理,直接在大块模型上做强化训练甚至会出现训练崩塌。 本文中,来自上海科学智能研究院等机构的研究者提出 T,给出一套「 先小后大」的课程:先在小块上学稳去噪轨迹,再逐级扩展到 B=8、16、32。4B 模型在 B=8 的 MATH500 设置下,相较原始 SDAR checkpoint 从 60.73 提升到 76.00。