字节 Seed 发现 DeepSeek-V4 长上下文检索准确率存在周期性波动
字节 Seed 发现 DeepSeek-V4 长上下文检索准确率按 Token 位置周期性起伏,根源在分块 KV Cache 压缩;这意味着常规平均分评测会掩盖这类问题。
字节 Seed 团队发现,DeepSeek-V4 系列在 128K 长上下文检索中,同一条信息换个位置,准确率最多相差 40.2 个百分点,且波动呈每 4 个 Token 一个周期的规律。他们进一步把原因指向该系列模型采用的 KV Cache(推理时缓存历史键值对、避免重复计算的技术)分块压缩方案——同一压缩窗口内不同位置被区别对待。团队据此建议,评测这类模型要按压缩相位分别测,而不是只看平均分。
正文摘录
Seed 研究人员发现,DeepSeek-V4 的表现竟然会随着信息的输入位置,每隔 4 个 Token 周期性变化。 在 128K 长上下文检索测试中,研究人员发现,同一条信息只是换了个位置,DeepSeek-V4 系列模型的检索准确率最高就能拉开 40.2 个百分点。 团队进一步发现,这个问题与 DeepSeek-V4 采用的一项长上下文优化技术有关—— 他们从 DeepSeek-V4 的官方推理代码中截取了一段 FP8 量化函数,让模型补全最后一个 Token。 为了搞清到底咋回事,研究人员在代码前面加了一段纯装饰性的文档字符串,里面放着一些重复的等号。 代码本身没改、要补全的位置没改、正确答案当然也没改……唯一的变化,就是前面多了这几个没什么实际意义的 Token。 更具体地说,在论文测试的 16 种填充长度中,当长度模 4 的余数为 0 或 1 时,模型倾向于错误答案 32;余数为 2 或 3 时,则倾向于正确答案 8。 研究人员构造了一段长达 128K Token 的上下文,里面包含约 1.6 万个键值对。 结果发现,DeepSeek-V4 系列的准确率曲线,竟然呈现出非常明显的周期性起伏。 其中 DeepSeek-V4-Flash-Base 在不同位置之间的最大准确率差距达到 40.2 个百分点 DeepSeek-V4-Flash-0731 的差距缩小到 19.1 个百分点,DeepSeek-V4-Pro-0813 缩小到 14.8 个百分点。 而更新的 DeepSeek-V4.1-Flash-0910,差距进一步降至 6.1 个百分点。 再往细看,DeepSeek-V4 的波动周期是 4 个 Token,DeepSeek-V4.1 则变成了 2 个 Token。