人大团队提出 ME-Decoding:解码筛选同时考虑概率与语义冗余
解码采样不该只看概率:人大团队用语义冗余给候选集去重,效果更好而延迟几乎不变,值得关注推理侧的落地价值。
大模型每一步解码都要从一组候选 token 中挑出下一个词。常用的 Top-p、Min-p 只按概率截断,但高概率 token 之间可能语义高度相似,等于重复保留同一条路径,而语义不同的候选反而被截掉。中国人民大学团队提出 ME-Decoding(马氏集成解码),把候选筛选当作子集优化问题,同时用概率和 token embedding(词向量,表示 token 语义的向量)判断保留哪些候选,在三个模型和三种温度下取得所比较方法中的最佳平均表现,端到端 GPU 延迟相比最快的概率截断基线只增加约 3%。
正文摘录
.jpg)  本文已被 EMNLP 2026 Main Conference 接收。论文第一作者为中国人民大学统计与大数据研究院博士研究生薛敦耀,通讯作者为中国人民大学代文林、孟澄研究员。 在一次解码步骤中,大语言模型面对的并不是唯一答案,而是一组具有不同概率的候选 token。为了提升解码多样性,现有方法往往不采取贪心选择的策略而是从概率分布中采样来得到下一步预测。为了避免采样到极小概率 token,Top-p、Min-p 等常用方法根据概率截断候选集合,再从剩余部分进行采样。 这些方法简单有效,但却忽略了一个问题: 概率高的 token,不一定能为候选集合带来新的信息 。多个高概率 token 可能在语义上高度相似,只是同一条生成路径的不同表达。如果只按概率筛选,它们会被同时保留;而一个概率略低、但能提供不同语义方向的 token,反而可能被提前截断。最终得到的候选集合看似 “可靠”,实际上却包含大量冗余。 中国人民大学代文林研究员、孟澄研究员团队提出的 Mahalanobis-Ensemble Decoding(ME-Decoding) ,将解码中的候选 token 筛选改写为一个动态子集优化问题。