三年,KV 缓存的优化史
2023 年 11 月 DeepSeek 发布第一代模型时,它的 KV 缓存是每 token 389,120 字节。这在当时并不特别。但到 2025 年 12 月的 DeepSeek-V3.2,这个数字变成 48,068,缩小了八倍。实验版 V3.2-Exp 专门引入 DeepSeek Sparse Attention(DSA),就是为了让长上下文的训练与推理都更便宜。再到 V4 Preview,DeepSeek 给它起的标题很讲究:《进入低成本百万级上下文时代》。重点不在"百万级上下文" ,而是在"低成本&