SAGE 用结构信号纠偏长推理,AC 实例验证通过率提升近 8 倍
这篇论文解释了长推理为何越走越偏,并给出一种在训练时用结构信号纠偏的方法,在硬任务上把验证通过率拉高近 8 倍。
大模型解短题往往流畅,但推理链一长,每一步看着都合理、最后却算不出答案。弗吉尼亚理工等团队在 NeurIPS 2026 提出 SAGE:先用符号闭包分析(SCA,一种把合法推理步和成功路径区分开的结构分析)解释长推理为何走偏,再把诊断结果变成训练时的引导信号。在 1190 个 Andrews-Curtis 实例上,Qwen3 的 Lean 验证通过率接近基础模型的 8 倍。
正文摘录
.jpg)  大模型解短题常能给出流畅答案,推理链一长,却可能每一步都看似合理、终点仍然失效。来自弗吉尼亚理工大学、威斯康星大学麦迪逊分校和达特茅斯学院的研究团队在 NeurIPS 2026 论文中提出 SAGE:用符号闭包分析(SCA)解释长推理中的探索偏差与累积偏差,再把这一诊断变成训练时的结构引导。在 12 个基准、7 个模型家族的评测中,SAGE 的总体表现优于所比较的后训练方法;在 Andrews–Curtis(AC)实例上,Qwen3 的 Lean 验证通过率接近基础模型的 8 倍。