行业新闻

PUMA 用语义冗余检测给推理模型早停,平均减少 26% Token 准确率持平

PUMA通过检测推理步骤的语义冗余来判定推理收敛,避免LRM过度思考,实现高效早停。

推理大模型常“想太多”,40-50%的token在答案生成后冗余。PUMA通过监测语义进展替代仅看答案置信度,当推理开始复述时停止,平均减少26.2% token且准确率基本不变。

正文摘录

用推理步骤的「语义冗余」给 LRM 过度思考踩刹车 ![](https://image.jiqizhixin.com/uploads/article/coverimage/e84740db-a231-4340-adb1-72c0b33d5325/08(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 推理大模型 (如 DeepSeek-R1、o1) 靠长思维链拿高分,却普遍「想太多」: 研究统计了五个代表性模型里,发现有 41–52% 的 token 是在模型给出它的最终答案之后生成的。现有的 inference-time early-exit 工作,大多盯着 trial answer 的 readiness—— 从当前推理前缀探测一个临时答案,看它置信度够不够高、连续几次是否一致、是否「看起来可以提交」。但答案看起来稳了,并不代表推理真的收敛了:模型可能还在探索、自我纠错的过程中,就短暂给出高置信、甚至连续一致的错误答案。 PUMA 换了个早停思路 —— 不只看「答案稳没稳」, 主要看「最近的推理还在不在产生新的语义进展」 : 当推理开始反复复述既有结论、不再提供新的语义信息时,说明推理大概率已收敛,这里才值得考虑停止。实验验证了这一信号可靠、可迁移、也可学习:在 5 个模型 × 5 个高难度基准上平均减少 26.2% token 且保持准确率,能零样本迁移到代码生成与多模态推理,乃至作为训练信号内化进模型。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-16原文

相关内容