DeepSeek V4.1-Flash重构长上下文架构降低显存成本
DeepSeek V4.1-Flash近日上线,核心变化是面向长上下文场景重写架构。模型采用因果编码器-解码器(CED)、第二代压缩稀疏注意力(CSA2)及low、high、max三档推理力度,在部分评测中能力超过上一代V4-Pro。其运行时显存占用减少约四分之三,持久化KV缓存降至上一代八分之一,摘要所称KV缓存规模最高下降437倍。
长上下文Agent最昂贵的环节是预填充:每次工具调用或多轮对话推进,模型都要重新遍历全部历史内容并生成KV缓存。CED将40层网络分为两段,前20层用因果编码器读取完整上下文并形成浓缩隐状态,后20层通过投影矩阵直接生成所需全局KV,从而使预填充计算量减少约一半。原本一次复杂任务约10元的算力成本,预计可降至1至2元。
为避免摘要丢失代码等局部细节,模型引入滑动窗口注意力(SWA)和有限回放机制,仅挑选少量Token近似恢复短期记忆,在精度与成本之间取得平衡。
CSA2主要解决缓存存储问题。相较上一代每层各自保存KV和Top-K索引,CSA2支持跨层复用,让40层共享同一份副本,并将层级运行分为Full、Reindex和Reuse三种模式,减少重复存储与索引计算。超长输入还会先建立浓缩索引池,后续层只在其中检索。
模型进一步采用FP4量化保存长期主KV,短期SWA-KV则使用FP8;训练阶段配合量化感知训练(QAT)降低精度损失。CSA2与FP4使单Token全局KV体积降至V4-Flash的四分之一,结合CED和有限回放后,持久KV缓存降至八分之一,其中约一半收益来自短期记忆及时释放,另一半来自长期记忆压缩。
V4.1-Flash主干参数为552B,另配196B Engram记忆模块,但预填充仅激活8B参数,解码阶段激活16B。它在DeepSWE v1.1中取得74.2%通过率,超过Opus-5.0和GPT-5.6-Sol,并在CyberGym测试中获得开源生态SOTA成绩。上下文从4K扩展至百万Token时,解码计算量仅增加约25%。
该架构与《Trace as State》都试图通过摘要和按需检索减少完整上下文重放,但前者是网络底层重构,后者属于不改变模型权重的推理阶段算法。若CED与CSA2被广泛采用,未来大模型可能更多结合稀疏计算、跨层复用和可控近似,而不再单纯依赖大型稠密Transformer。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文