清华提出 LAVE 约束解码,提升扩散语言模型语法正确率
扩散语言模型常写错代码,LAVE 用“前瞻+验证”把语法正确率拉高到接近 100%,且不牺牲效率。
扩散语言模型生成代码、JSON 等语法受限内容时错误率偏高。清华团队提出 LAVE 方法,先推测候选补全,再用语法解析器验证,将多个模型的语法正确率提升至接近 100%,且推理开销很低。论文已被软件工程顶会 ISSTA 2026 接收。
正文摘录
.jpg)  扩散语言模型展现出较高的发展潜力,但在代码等形式语言生成任务中,仍难以稳定满足语法约束。 针对这一问题,本文提出了针对扩散语言模型约束解码方法 —— LAVE,通过对扩散语言模型的中间输出进行前瞻补全与语法验证,为模型生成过程提供了可靠的语法保障。 实验表明,LAVE 能够显著提升多种扩散语言模型生成形式化语言(例如源代码、JSON、化学表达式)的语法正确率,同时改善功能正确率,并保持较低的推理开销。相关论文已被软件工程顶会 ISSTA 2026 接收,代码已开源。 本研究由 清华大学人工智能学院 AI Agent 课题组 完成。通讯作者为 清华大学人工智能学院李佳助理教授 ,主要研究方向包括 AI Agent、AI Safety、Software Engineering 等。第一作者 张奕彤 为清华大学人工智能学院 2026 级直博生,主要研究方向为 AI Safety。