认识 DeepSeek V4.1 Flash:5520 亿参数把自己家旗舰送下线,KV 缓存缩到初代的 1/437
说个有点黑色幽默的事。
2026 年 9 月 10 日,DeepSeek 发了新模型的公告。按惯例这种公告都在吹自己多强,但这份公告里有这么一句:
"我们计划有序下线 V4 Pro。" 北京时间 2026 年 9 月 14 日 12:00 之后,至 V4.1 Pro 上线之前,用户访问
deepseek-v4-pro的请求将全部路由到 V4.1 Flash,并按 V4.1 Flash 单价计费。
翻译过来就是:我们家上一代最贵最强的旗舰,被这个新来的"Flash"版本打趴了,我们不卖了。
我盯着这句话看了很久。从业内常识看这挺反常——"Flash"在模型命名里基本等于"青春版""缩水版",是给省钱的人准备的。结果这次,这个"快版本"把正主给干掉了,而且价格还降了。
一组更反直觉的数字:相比上一代 V4 Flash,V4.1 Flash 的输入价格降了约 33%,缓存命中输入降了约 60%,输出降了约 11%。参数往上走,价格往下走。 这两年大家习惯的"更强 = 更贵"曲线,被掰弯了。
而最让我反复看了两遍的,是下面这个数:
| 模型 | 全局 KV Cache(每 token 字节数) | 时间 |
|---|---|---|
| DeepSeek-V1 | 389,120 | 2023.11 |
| DeepSeek-V3.2 | 48,068 | 2025.12 |
| DeepSeek-V4-Flash | 3,514 | 2026.04 |
| DeepSeek-V4.1-Flash | 890 | 2026.09 |
437 倍。 不到三年,把每个 token 的"记忆成本"压到了初代的四百三十七分之一。
我一直觉得,Agent 时代的账单里最冤的一笔钱叫"复读费"——你每一轮对话都在为模型重新读一遍你上一轮已经给过它的东西付费。 过去两年行业比的是"谁的模型更大、分更高",从 V4.1 Flash 开始,有人开始认真算另一本账:谁记得更便宜。
什么是 DeepSeek V4.1 Flash
DeepSeek V4.1 Flash 是深度求索(DeepSeek)于 2026 年 9 月 10 日发布并开源的多模态 MoE 大模型。552B 骨干参数 + 196B Engram 条件记忆参数,采用全新的非对称 Causal-Encoder-Decoder 架构——预填充阶段每 token 只激活 8B 参数,解码阶段激活 16B;支持 100 万 token 上下文、最长 384K 输出;原生图文理解;以 MIT 协议在 Hugging Face 开放权重,并同步发布技术报告。
权重在 Hugging Face 和 魔搭 ModelScope,技术报告 PDF 在 HF 仓库里一起挂着。
先把几个最容易搞错的点讲清楚:
第一,"Flash"不是缩水版,是"新架构系列里最小的一个"。 官方原话是"这是我们全新模型结构系列中的最小尺寸的模型"。这句话的潜台词很吓人:更小的它已经把 V4 Pro 干掉了,那后面更大的 V4.1 Pro 会是什么水平? Flash 在这里不是"阉割",是"首发试验田"。
第二,真正的主角是那个"非对称"。 输入激活 8B、输出激活 16B,两边不一样。为什么这么设计?因为 Agent 的工作负载天然就是输入密集型——它不停地读文件、读工具返回值、读历史对话,但每次真正吐出来的 token 并不多。让"读"便宜、"写"贵一点,是照着真实账单反推出来的架构。
第三,它是"原生多模态",不是外挂一个视觉编码器。 视觉编码器(DeepSeek-ViT,从零训练,2D-RoPE + 3×3 像素反混叠下采样)通过一个两层 MLP 投影器把图像转成视觉嵌入,从语言模型预训练的第一天起就与文本嵌入联合训练。区别在于:外挂方案是"先学会说话,再学会看图",原生方案是"说话和看图是同一件事"。
第四,权重开源归开源,但你大概率跑不动。 MIT 协议,权重 FP8 格式,社区按权重文件统计总参数量接近 4846 亿。这不是"租张 4090 试试"的量级,而是"2000 张 GPU 加一套存储集群"的量级——DeepSeek 在公告里甚至直接留了句"规划 2000 卡以上大规模部署?欢迎来聊"。这行字本身就是一句很诚实的用户引导:普通人请用 API。
它有什么特点
- 非对称 CED 架构,prefill 算力几乎砍半。 40 层 Transformer 拆成 20 层因果编码器 + 20 层解码器。受 YOCO 启发,解码器不再自己逐层算全局 KV,而是从编码器最后一层隐藏状态投影得来——prompt 走到编码器就停了。配合 128 token 的滑动窗口注意力(SWA),解码器侧缺失的 SWA 状态只靠重放最后 128 个 token 重建,这招官方叫 SWA Bounded Replay。
- KV Cache 每 token 890 字节,HBM 只要 1/4,SSD 只要 1/8。 主 KV 用 FP4 量化(E2M1 格式,每 16 个通道配一个 E4M3 缩放因子),靠后训练阶段的量化感知训练引入,相比 V4 的 FP8 缓存存储再降近一半。工程侧更狠:SWA KV 不再落 SSD,改放在从主机 DRAM 划出 10% 的分布式池里、TTL 分钟级;全局 KV 则保证 72 小时生命周期。
- CSA2 跨层复用,把缓存沿着"层"这个维度再压一遍。 每个 CSA2 层被静态分配三种模式之一:Full(自己算主 KV、选新的 Top-512 索引)、Reindex(复用上层主 KV 和索引器 K,用自己的索引器 Q 重新打分)、Reuse(连 Top-K 索引一起复用,直接跳过索引器)。解码器里还有个层次化稀疏索引器,让 Full 层先建一个最多 16,384 位置的候选池,后面的 Reindex 层只在这个池子里打分——把深层索引器的计算成本和上下文长度彻底解耦。
- 上下文从 4K 拉到 1M,单 token 解码 FLOPs 只涨 1/4。 这是我觉得最违背直觉的一条。正常情况上下文涨 250 倍,注意力计算要炸;它靠上面那套稀疏方案硬是压住了。长上下文终于从"贵得不敢开"变成"默认就开着"。
- 45 万亿 token 预训练,7:1 的图文配比。 稀疏注意力从零就在 64K 序列长度上训练(没有 dense warmup),训练到 34T token 时把上下文扩到 100 万。官方的说法是:基座模型在世界知识和代码上追平 DeepSeek-V4-Pro-Base,但只用了 1/3 的总参数和 1/4 的激活参数。
- 后训练没发明新算法,全靠堆数据和环境。 标准 SFT → RL → 在线蒸馏(OPD)三段式,一个算法都没改。提升来自三件事:大规模自动合成可验证的 Agent 任务与环境、跨 6 种异构 Agent 框架做 RL(Claude Code、Codex、OpenCode、Pi、mini-SWE、DeepSeek Harness)、以及从 40 多个教师模型做 on-policy 蒸馏。
- 推理强度 1–100 连续可调。 不是简单的"思考/不思考"两档,而是一个整数旋钮,在推理成本和准确率之间连续权衡。API 侧对应 low / high / max 三档,默认 high。这是我见过最务实的一个设计——终于把"想多久"的主动权还给了用户。
- 实测成绩(最高推理强度): Terminal-Bench 2.1 拿 90.6(上代 Flash 82.7、Claude Opus 5 89.1、GPT-5.6 Sol 88.8);DeepSWE v1.1 从 54.4 暴涨到 74.2(Opus 5 74.0、GPT-5.6 Sol 73.0);Automation-Bench 从 37.7 到 54.8;GPQA Diamond 90.9;Codeforces 评级 3471(上代 3289)。
泼盆冷水:Terminal-Bench 4.0 上它只有 31.2,明显低于 Opus 5 的 51.8;GPQA Diamond 90.9 也没打过 Opus 5 的 93.4。 它赢在"干活",没赢在"全知"。 这两个能力不是一回事,别看着 Agent 榜单就开始幻想它能替代一切。
用在哪儿
场景一:长程编程 Agent。 这是它最硬的战场。Terminal-Bench 2.1 的 90.6 分意味着在实际的终端操作、多步排错、工具调用链条上,它已经跑到了开源第一梯队的前面。
场景二:带"眼睛"的办公自动化。 原生多模态不是用来聊图的,是用来做检查闭环的——让 Agent 截个图看看自己刚生成的前端页面长什么样、生成的表格对不对,然后自己纠错。 我认为这才是原生视觉在 Agent 里的真正价值:把"执行 → 检查 → 修正"这个循环补全了,而以前这个循环缺了"检查"这一环,只能靠人肉兜底。腾讯研究院在点评里把这个方向概括为向"泛白领场景"扩张,我同意这个判断。
场景三:百万上下文的批量文档处理。 1M 上下文 + 缓存命中 0.02 元/百万 token,意味着"塞进去一整年的合同再问问题"在经济上第一次变得可算了。注意,真正的省钱点在缓存命中,不在模型本身。
生态落地方面,几个可查的节点:
- WorkBuddy(含 CodeBuddy)与 OpenCode 已在发布当天全量接入 V4.1 Flash,这是官方公告里明确点名的合作伙伴。
- 2026 年 9 月 10 日,V4.1 Flash 上线国家超算互联网。
- 推理侧给了 vLLM、SGLang、Transformers 三条路;Hugging Face 上 MIT 权重发布数小时内,社区 GGUF 量化版就出现了。
- 第三方平台同步上架,OpenRouter 上
deepseek/deepseek-v4.1-flash的定价与官方高峰价对齐(输入 $0.3、输出 $1.2 每百万 token)。
初体验
说实话,对 99% 的人来说,"初体验"就是改一个字符串。
用 API(推荐)
DeepSeek 的 API 是 OpenAI 兼容的,把模型名改成 deepseek-flash 就行:
from openai import OpenAI
client = OpenAI(
api_key="sk-你的密钥",
base_url="https://api.deepseek.com",
)
resp = client.chat.completions.create(
model="deepseek-flash", # 就这一行
messages=[
{"role": "user", "content": "读一下这份日志,找出三个最可疑的报错并给出排查顺序"}
],
)
print(resp.choices[0].message.content)几个实用提醒:
- 旧模型名
deepseek-v4-flash、deepseek-v4-flash-vision-exp已下线,但为兼容暂时路由到 V4.1 Flash,按新价格计费。 - 2026 年 9 月 14 日 12:00(北京时间)之后,
deepseek-v4-pro也会路由过来。 如果你线上还写死着 V4 Pro,这几天最好确认一下计费变化。 - 走 OpenAI 兼容的生态基本都能直接用,LiteLLM、OpenRouter 这类网关也已经支持。
价格(每百万 token,2026 年 9 月 10 日 12:00 生效)
| 时段 | 输入(缓存命中) | 输入(缓存未命中) | 输出 |
|---|---|---|---|
| 闲时 | 0.02 元 | 1.0 元 | 4.0 元 |
| 高峰 | 0.04 元 | 2.0 元 | 8.0 元 |
高峰时段是工作日 9:00–12:00、14:00–18:00(北京时间),其余时间(含周末)全是闲时。闲时价格是高峰的一半。
我给你一个最实在的建议:把能延后的批处理任务全部挪到闲时,尤其是晚上和周末。 同样的任务,账单直接对折——这可能是整篇文章里投入产出比最高的一条。
想自己部署的话
官方在 HF 仓库里放了推理实现代码,涵盖了视觉编码器与对齐器、滑动窗口注意力、带两级索引器的压缩稀疏注意力、Engram n-gram 查找、MoE、Hyper-Connections 和 DSpark 前向过程,适合用来读懂结构。大致流程是:
# 1. 装依赖
python -m pip install -r requirements.txt
# 2. 从魔搭下载权重
export MS_CKPT_PATH=/path/to/DeepSeek-V4.1-Flash
modelscope download --model deepseek-ai/DeepSeek-V4.1-Flash --local_dir "${MS_CKPT_PATH}"
# 3. 转换成 8 路张量并行格式
export SAVE_PATH=/path/to/DeepSeek-V4.1-Flash-TP8
export MP=8
python convert.py \
--hf-ckpt-path "${MS_CKPT_PATH}" \
--save-path "${SAVE_PATH}" \
--model-parallel "${MP}" \
--expert-dtype fp4 \
--tokenizer-path "${MS_CKPT_PATH}"
# 4. 跑起来
export CKPT_PATH=/path/to/DeepSeek-V4.1-Flash-TP8
INPUT_FILE=examples/example.txt ./run.sh
# 交互式对话
torchrun --nproc-per-node 8 generate.py --ckpt-path "${CKPT_PATH}" --config config.json --interactive --temperature 0.6想先验证环境对不对,官方还留了个自检入口:python model.py 会用默认配置搭个小模型,跑一次 prefill 加 22 步 decode,并调用真实的 dense-fp8 与 MoE-fp4 内核。
还是那句话:权重是 MIT 的,但不是给你在单卡上跑的。 552B 骨干 + 196B Engram,FP8 权重文件几百 GB 起步。 我见过太多人兴冲冲下载完开源权重,然后卡在"为什么我的机器加载不起来"上。本地部署这套流程的真实用途是学习和复现结构,生产请老老实实调 API。
进阶
我的个人判断:V4.1 Flash 真正的信号不是分数,是它把行业竞争的坐标轴挪了一下。
过去评判一个模型的三个维度是:参数、跑分、价格。V4.1 Flash 硬塞进来第四个维度——每个 token 的记忆成本。890 字节这个数字,可能比 Terminal-Bench 的 90.6 更值得记住。因为当 Agent 从"聊几句"进化到"连续干几小时"时,缓存就是它的内存,内存的价格决定了它能不能规模化。 DeepSeek 这次等于在说:我把内存价格打下来了,你们随便跑。
还有一个我觉得被低估的细节:后训练没发明任何新算法。 官方技术报告写得很清楚,SFT → RL → OPD 的范式一个字没改,所有提升都来自"大规模合成可验证任务与环境"和"跨异构 scaffold 的 RL"。路径变了:从卷算法变成卷数据和环境。 这对整个行业是个挺清醒的提醒——谁能拿到高质量的任务反馈、谁能造出有效的训练环境,谁就能持续迭代。这比"又一篇新论文"朴素,但可能也更难抄。
当然要泼几盆冷水:
- 别被 Flash 这个名字骗了,它不是"全面最强"。 Terminal-Bench 4.0 只有 31.2(Opus 5 是 51.8),GPQA Diamond 也没赢。它在编程与 Agent 执行上很猛,在纯知识与最难的长程任务上还有明显差距。
- 把 V4 Pro 下线是有风险的迁移。 9 月 14 日之后 Pro 请求会被静默路由到 Flash,虽然官方说各项指标全面超越,但你的业务 prompt 是在 Pro 上调出来的,路由之后表现是否一致,得自己跑一遍回归再下结论。
- 所有 benchmark 都来自 DeepSeek 自述,第三方复现还需要时间。
一个务实的起步建议:别一上来就替换主力模型。 挑一类你业务里高频但容错高的任务(日志摘要、工单分类、批量字段抽取),用 deepseek-flash 跑 1000 条真实数据,同时盯三个数——准确率、端到端延迟、实际账单(尤其是缓存命中率)。把任务排到闲时再跑一遍,看看账单能差多少。 这三个数跑通了,再谈替换。
毕竟,一个把自己家旗舰都送下线的模型,值得你认真测一测——但不值得你无脑全量切过去。
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
