产品派
返回

研究发现DeepSeek长上下文表现受Token位置影响

AI量子位2026/10/9 15:11:55
AI 导读

字节Seed团队发现,DeepSeek-V4系列模型的表现会随输入信息的位置周期性变化。同一道题仅在前面增加无关Token,答案就可能改变;V4的波动周期为4个Token,长上下文检索准确率最高相差40.2个百分点。

这一现象与模型采用的分块KV Cache压缩有关。该技术将连续Token按窗口压缩,以降低长上下文推理的内存和计算开销,但也可能让信息因相对压缩边界的位置不同而被模型区别对待。

在代码补全实验中,研究人员让DeepSeek-V4-Flash-Base补全FP8量化函数的最后一个Token,正确答案为8,模型却有时输出32。代码和任务均不变,只调整前置文档字符串中的等号数量,答案便以4个Token为周期在8与32之间反复切换。

16种填充长度中,长度除以4余0或1时更倾向输出32,余2或3时更倾向输出8;两组位置上,错误答案与正确答案的平均概率分别为71.3%和26.4%,另一组则反转为7.2%和91.5%。

在128K Token、约1.6万个键值对组成的“大海捞针”测试中,仅改变目标信息相对压缩窗口的位置,Flash-Base和Pro-Base的准确率最大差距分别为40.2和34.8个百分点。后训练后,Flash-0731、Pro-0813和V4.1-Flash-0910的差距降至19.1%、14.8%和6.1%,但周期性仍在;V4.1周期变为2个Token。

研究人员进一步基于Qwen3-0.6B训练模型。所有分块压缩方案都出现与压缩步长对应的周期波动,步长为4、6、8时周期分别约为4、6、8个Token;全注意力基线没有同等现象。移除RoPE或把可学习压缩权重改为平均值后,问题仍存在,说明它源于分块压缩本身。

注意力头分析显示,不同组件对压缩窗口内的不同位置各有偏好,形成“相位专门化”,部分位置因此成为弱点。理论分析认为,训练中的梯度流会促成稳定的位置偏好,而非随机噪声。

团队建议,评估此类模型不能只看平均检索分数,还应将同一信息放在不同压缩相位分别测试。KV Cache压缩仍能显著节省长上下文成本,但可能牺牲位置一致性;后训练和架构迭代可缩小差距。论文地址:https://arxiv.org/pdf/2609.36322

DeepSeekKV Cache长上下文大模型评测

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文