行业新闻

SAGE 用结构信号纠偏长推理,AC 实例验证通过率提升近 8 倍

这篇论文解释了长推理为何越走越偏,并给出一种在训练时用结构信号纠偏的方法,在硬任务上把验证通过率拉高近 8 倍。

大模型解短题往往流畅,但推理链一长,每一步看着都合理、最后却算不出答案。弗吉尼亚理工等团队在 NeurIPS 2026 提出 SAGE:先用符号闭包分析(SCA,一种把合法推理步和成功路径区分开的结构分析)解释长推理为何走偏,再把诊断结果变成训练时的引导信号。在 1190 个 Andrews-Curtis 实例上,Qwen3 的 Lean 验证通过率接近基础模型的 8 倍。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/b2e136e5-7d43-4cd0-9bd9-cc3489e84cdd/016(2).jpg) ![图片](https://mmbiz.qpic.cn/mmbizjpg/5L8bhP5dIqFg0WfYlyqqeepLD4C3TibGpjf6FOH7EVuKjibcnDe74qjAU9XhgHylI3WghS7ricbx1ckkNhJHaQ2AnGqG5ZmOdwHJQLl99bxYHU/640?wxfmt=webp&from=appmsgimgIndex=0) 大模型解短题常能给出流畅答案,推理链一长,却可能每一步都看似合理、终点仍然失效。来自弗吉尼亚理工大学、威斯康星大学麦迪逊分校和达特茅斯学院的研究团队在 NeurIPS 2026 论文中提出 SAGE:用符号闭包分析(SCA)解释长推理中的探索偏差与累积偏差,再把这一诊断变成训练时的结构引导。在 12 个基准、7 个模型家族的评测中,SAGE 的总体表现优于所比较的后训练方法;在 Andrews–Curtis(AC)实例上,Qwen3 的 Lean 验证通过率接近基础模型的 8 倍。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-10-07原文

相关内容