技术

DeepSeek V4.1 Flash缓存降60%

Adrian Kessler

DeepSeek V4.1 Flash 运行在公司称之为 Causal Encoder-Decoder 的新架构上。它的 5520 亿参数分布在 20 层编码器和 20 层解码器中,但输入 token 上只激活 80 亿参数,输出 token 上激活 160 亿。这使得它在结构上比那些每次操作都要激活更大参数切片的模型更精简——这一设计选择直接转化为推理成本和内存效率上的优势。

内存方面的收益是明确的。V4.1 Flash 的 KV 缓存每个 token 占用 890 字节,约为 V4-Flash 的四分之一。FP4 缓存和 Compressed Sparse Attention 2 把常驻缓存占用压到上一代的八分之一。目前非高峰时段缓存输入的价格为每百万 token 0.003 美元,较 V4-Flash 下降 60%。未缓存输入下降 33%,输出下降 11%。

在开发者最关心的基准测试上,它站得住脚。自主软件工程测试 DeepSWE v1.1 给它打出 74.2,以微弱优势领先 Anthropic 的 Opus 5(74.0),也高于 GPT-5.6 Sol(73.0)。GPQA Diamond 得分 90.9。最显眼的差距是 Terminal-Bench 3.0:30.0 对 Opus 5 的 43.3,在需要长时间交互式调试的任务上,这个差距是实打实的。

视觉能力从预训练阶段就已内置其中。此前的 V4 把视觉拆成了单独的 Vision-Exp 变体,V4.1 Flash 则用一个围绕 DeepSeek-ViT 构建的单一模型取代了这两者。DeepSeek-ViT 是一个专门训练的编码器,从一开始就与语言模型共同开发。多模态这一档已经不存在了——每次调用默认都能获得视觉能力。

上下文窗口为 100 万 token,输出上限为 38.4 万 token,足以支撑长文档分析和长程智能体工作流,无需分块。现有使用旧版 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp ID 的 API 调用者,已经会被路由到 V4.1 Flash。9 月 14 日起,DeepSeek V4 Pro 的流量也会切换过去,并按 Flash 定价计费。

DeepSeek 这样描述 V4.1 Flash:“这是我们新架构家族中最小的一款模型。”言下之意,同一 Causal Encoder-Decoder 设计下还会有一款更大的 V4.1 Pro。如果它能延续 Flash 的效率轨迹,就会让这一架构的性能/美元比继续沿基准曲线向上延伸,进入目前由每百万 token 价格明显更高的模型占据的地带。

架构层面的意义并不仅限于定价表。在长上下文场景下运行大模型时,KV 缓存的增长是主要限制条件,它会随每个被处理的 token 增长。V4.1 Flash 的思路——更少的激活参数、压缩缓存——直接应对了这一限制。它是长上下文部署中可用的模板,而不是针对边界情况的优化。

标签: , , , , ,

讨论

有 0 条评论。