PUMA 用语义冗余检测给推理模型早停,平均减少 26% Token 准确率持平
PUMA通过检测推理步骤的语义冗余来判定推理收敛,避免LRM过度思考,实现高效早停。
推理大模型常“想太多”,40-50%的token在答案生成后冗余。PUMA通过监测语义进展替代仅看答案置信度,当推理开始复述时停止,平均减少26.2% token且准确率基本不变。
正文摘录
用推理步骤的「语义冗余」给 LRM 过度思考踩刹车 .jpg)  推理大模型 (如 DeepSeek-R1、o1) 靠长思维链拿高分,却普遍「想太多」: 研究统计了五个代表性模型里,发现有 41–52% 的 token 是在模型给出它的最终答案之后生成的。现有的 inference-time early-exit 工作,大多盯着 trial answer 的 readiness—— 从当前推理前缀探测一个临时答案,看它置信度够不够高、连续几次是否一致、是否「看起来可以提交」。但答案看起来稳了,并不代表推理真的收敛了:模型可能还在探索、自我纠错的过程中,就短暂给出高置信、甚至连续一致的错误答案。 PUMA 换了个早停思路 —— 不只看「答案稳没稳」, 主要看「最近的推理还在不在产生新的语义进展」 : 当推理开始反复复述既有结论、不再提供新的语义信息时,说明推理大概率已收敛,这里才值得考虑停止。实验验证了这一信号可靠、可迁移、也可学习:在 5 个模型 × 5 个高难度基准上平均减少 26.2% token 且保持准确率,能零样本迁移到代码生成与多模态推理,乃至作为训练信号内化进模型。