更智能、更高速,具备原生视觉理解能力的 DeepSeek-V4.1-Flash 现已上线 Bitdeer AI Model Studio
三年,KV 缓存的优化史
2023 年 11 月 DeepSeek 发布第一代模型时,它的 KV 缓存是每 token 389,120 字节。这在当时并不特别。但到 2025 年 12 月的 DeepSeek-V3.2,这个数字变成 48,068,缩小了八倍。实验版 V3.2-Exp 专门引入 DeepSeek Sparse Attention(DSA),就是为了让长上下文的训练与推理都更便宜。再到 V4 Preview,DeepSeek 给它起的标题很讲究:《进入低成本百万级上下文时代》。重点不在"百万级上下文" ,而是在"低成本"。2026 年 4 月的 V4-Flash,缓存降到 3,514 字节,而 DeepSeek V4.1 Flash 的 KV 缓存数据更是降低到了至 890。

来源:DeepSeek
三年过去,DeepSeek 提供了"倍数"级的改进。相比上一代,DeepSeek V4.1 Flash 只需要 1/4 的 HBM 和 1/8 的 SSD 存储。
DeepSeek V4.1 Flash 是什么
DeepSeek V4.1 Flash 是一个 5520 亿参数的 MoE 模型,为DeepSeek 全新架构家族中最小的成员,而这个家族基于 Causal Encoder–Decoder 设计,在激活参数上做了一件不太常见的事:把"读"和"写"当成两份不同的工作,给了不同的预算:输入侧 80 亿激活参数负责处理输入,输出侧 160 亿负责生成。
这个非对称拆分不是随手划分,它对应的是工作量的真实分布。一个 Agent 在解析 200 个文件的仓库、一段很长的工具调用日志,或者一叠截图时,读的量极大,写的量相对很小。如果按"更难的那一半"来给两边统一配置算力,那么上下文里的每一个 token 都在浪费;分开配置就不会。再叠加上每 token 890 字节的缓存,这个模型被优化的对象非常明确:是长时间运行的 Agent,而非简单的一轮对话。
DeepSeek 把能力提升归因于新的预训练方法,以及更大规模的强化学习后训练。另外值得单独点出来的是:它给了这个模型原生视觉理解能力,不是在文本模型上外挂一个视觉适配器,而是把多模态输入做成架构属性。
以上数据均参考 DeepSeek 2026 年 9 月 10 日官方公布数据。
基准测评成绩
DeepSeek 公布的对比对象包括自家 V4-Pro(0813)与 V4-Flash(0731),以及 GLM-5.3、Kimi K3、GPT-5.6-Sol、Claude Opus 5。

来源:DeepSeek
对运行 Agent 的团队意味着什么
一个 Agent 做重构,可能会调用六十次工具。每一次都会往它必须继续背着的历史里再追加一段。每一步的输出是几百个 token;上下文是几万个,而且还在长。把上下文里每一个 token 的缓存开销乘进去,就能看出钱花在哪了。也就能看出,把 HBM 减少到 1/4、SSD 减少到 1/8,和把输出价格削减一点,是两类完全不同的改进。前者与其说是让每一步更便宜,不如说是让"更多步"成为可能。而对一个只有跑完才算创造价值的 Agent 来说,这才是真正卡住它的约束。
适用场景
最清晰的落点是长周期的工程工作:仓库级重构、CI 失败定位、需要 Agent 在很长的工具调用历史里保持连贯的多步后端任务。这正是 Terminal-Bench 3.0 与 4.0 相比 V4-Pro 翻倍以上所反映的能力,也是"HBM 占用小四倍"能在一次运行的每一步上不断累积收益的地方。
其次是高并发 Agent 流水线:单步成本决定你能负担多少步的那类工作流。在这里,"以输入 8B、输出 16B 的激活参数拿下 DeepSeek 全表 Automation-Bench 与 Agents' Last Exam 最高分"是真正相关的事实。
安全团队有一个更窄但十分真实的切入口。CyberGym 的 88.1 是 DeepSeek 公布数据中的最高分,高于此前的 83.3,SEC-Bench Pro 与 ExploitGym 相比 V4-Pro 也都有明显提升。但两项都仍落后于 GPT-5.6-Sol,所以诚实的定位是漏洞初筛、安全代码审查与崩溃分析,而不是端到端的漏洞利用推理。
除此之外还有两类:可以省掉抽取环节的文档与视觉理解流水线。
通过 API 在 Bitdeer AI Model Studio 运行 DeepSeek V4.1 Flash
您可以在 Bitdeer AI Model Studio 上运行 DeepSeek V4.1 Flash,而无需管理底层基础设施,从而降低了部署复杂性和实现价值的时间。作为 NVIDIA 优选云服务合作伙伴(Preferred NVIDIA Cloud Partner),并通过 ISO/IEC 27001:2022 与 SOC 2 Type I & Type II 认证,我们为生产级 Agentic 部署提供所需的安全、合规与高性能底座。
如何开始
- 登录 Bitdeer AI Model Studio。
- 在模型列表中找到 DeepSeek V4.1 Flash。
- 生成 API 密钥并开始进行 API 调用。
curl -v --location 'https://api-inference.bitdeer.ai/v1/chat/completions' --data '{"model":"deepseek-ai/DeepSeek-V4.1-Flash","messages":[{"role":"system","content":"You are a knowledgeable assistant. Provide concise and clear explanations to scientific questions."},{"role":"user","content":"Can you explain the theory of evolution in simple terms?"}],"max_tokens":200,"top_p":1.0,"temperature":1.0,"frequency_penalty":0.0,"presence_penalty":0.0,"seed":0,"stream":false}' --header 'Authorization: Bearer <API_KEY>'