跳到正文
Baseten Blog·· 26 天前精选AI 评分64

DeepSeek 发布开源权重模型 DeepSeek-V4.1-Flash,面向编码智能体优化 prefill 效率

DeepSeek-V4.1-Flash: more efficient prefill for coding agents

AI 导读

DeepSeek 本周在 HuggingFace 发布 DeepSeek-V4.1-Flash 开源权重,模型已在 Baseten Model APIs 上线。

推荐理由

梳理了 V4.1-Flash 的 CED 架构与 KV cache 优化如何降低 prefill 成本,并给出与 V4-Pro、V4-Flash 的基准对比。

正文 · AI 翻译

本周,DeepSeek 在 HuggingFace 上发布了 DeepSeek-V4.1-Flash 的开放权重,该模型已经在 Baseten Model APIs 上线(Loops 支持即将推出)。关键规格包括:

  • 552B 总参数

  • 预填充阶段激活 8B 参数,解码阶段激活 16B 参数

  • 1M token 上下文窗口

  • 多模态输入(文本 + 图像),文本输出

“flash”这一命名最初由 Google 的 Gemini 系列推广开来,用于描述更轻量、更便宜的模型,其设计目标是在性能上接近更大的模型。V4.1-Flash 是 DeepSeek 今年发布的第三个开放权重 flash 版本,与 Z.ai 和阿里巴巴近期的发布一同出现,反映出模型实验室正在为编码智能体工作负载提供更高智能、更低价格的方案。

对比 DeepSeek 模型:旧版与新版 

DeepSeek V4.1-Flash 在文本和多模态能力上均展现出相较 V4-Flash 和 V4-Pro 模型的改进。

在编码和智能体基准测试中,V4.1-Flash 以大约三分之一的总参数量击败了 V4-Pro。提升最大的是长时程智能体任务,实现了两位数增长,而单次命令行任务的提升则较为温和。这些进步是真实的,但 Automation-Bench 上 54.8 的得分意味着它大约有一半的复杂工作流会失败。在智能体流水线中仍需保留人工介入。

摘自 HuggingFace DeepSeek-ai/DeepSeek-V4.1-Flash 模型卡
*所有列出的基准测试满分均为 100。

V4.1-Flash 是 DeepSeek 首个具备原生图像输入的非实验性模型,此前该能力仅限于 V4-Flash-Vision-Exp。这一代的视觉推理也有所提升,尤其是在图表解读和基于图像的逻辑推理方面,如果你要输入截图、仪表盘或 UI 原型图,这些能力会很有用。不过,ZeroBench 得分仍未达到 50,在这一水平下,对于任何重要事项,你仍然需要人工审查基于图像的推理结果。

摘自 HuggingFace DeepSeek-ai/DeepSeek-V4-Flash-Vision-Exp 模型卡
*所有列出的基准测试满分均为 100。

DeepSeek 已在其平台上退役 V4-Flash 模型,现在将其流量路由至 V4.1-Flash。V4-Pro 流量也将从 9 月 14 日开始重新路由。如果你正在运行任何 DeepSeek V4 模型,请升级到 V4.1-Flash。如果你正在使用其他实验室的大型通用模型,并希望获得更强、更高效的编码和智能体性能,它也值得一看。

非对称激活参数以实现更高效的计算利用

DeepSeek-V4.1-Flash 是唯一采用因果编码器-解码器(CED)架构的同等规模模型。

模型计算中的两个关键步骤是:

  • 预填充:读取输入

  • 解码:生成输出

其他 MoE 模型在预填充和解码步骤中激活相同数量的参数。CED 将 V4.1-Flash 的 40 层拆分为 20 层因果编码器和 20 层解码器,解码器的 KV 缓存直接从编码器的输出投影而来。这意味着预填充只需运行编码器,每个 token 激活 8B 参数,而解码则运行完整模型,激活 16B 参数。 

其思路是生成输出比读取输入更难,因此计算优先级放在解码而非预填充上。作为对比,V4-Flash 在预填充和解码时均激活 13B 参数,因此 V4.1-Flash 以更重的解码(16B)换取了更轻的预填充(8B)。

✕

CED reduces prefill computation by stopping at the encoder and reusing a projected KV cache during decoding.CED 通过在编码器处停止,并在解码期间复用投影后的 KV 缓存,减少了预填充计算量。

这一设置提升了编码智能体的成本效率,因为智能体循环生成的预填充 token 远多于解码 token。此外,由于解码器的键值状态是从编码器输出投影而来,而非在每一层独立计算,CED 有助于实现更小的 KV 缓存,从而降低缓存成本。

通过 KV 缓存改进进一步节省成本

据 DeepSeek 称,V4.1-Flash 的全局 KV 缓存所需内存仅为 V4-Flash 的四分之一。CED 架构通过从编码器输出投影解码器的 KV 缓存,而非独立计算,从而做出贡献。它还与另外两项技术协同工作,进一步减少 KV 缓存。

  • 压缩稀疏注意力 2:在注意力层之间共享键值条目

  • FP4 KV 缓存:以更低精度存储键值条目。

✕

DeepSeek-V4.1-Flash’s global KV cache requires less memory per token.DeepSeek-V4.1-Flash 的全局 KV 缓存每个 token 所需内存更少。

摘自 Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient.

每个 token 占用更少内存意味着缓存中能容纳更多上下文,从而提高命中率。当提示词的前缀已被缓存时,模型会跳过对这些 token 的注意力重计算,从而缩短首 token 时间并提升每 GPU 吞吐量。编码智能体受益最大,因为智能体循环在每一步都会重新发送大体相同的上下文。要在生产环境中实现这种复用,取决于请求如何在 GPU 之间路由,而这正是服务栈发挥作用的地方。

DeepSeek-V4.1-Flash 的生产推理

Baseten Inference Stack 通过 NVIDIA Dynamo 和 KV 缓存感知路由来处理这种路由,将每个请求引导至已持有其前缀的副本,而不是哪个副本空闲就发给哪个。

✕

“KV-aware routing sends requests to replicas that already have relevant context cached, saving time by avoiding redundant prefill computation.”“KV 感知路由将请求发送到已缓存相关上下文的副本,通过避免冗余的预填充计算来节省时间。”

摘自 2x faster inference with KV cache-aware routing

所有这些都在 Baseten Model APIs 背后运行,DeepSeek-V4.1-Flash 现已可用。可在我们的 Model Library 中试用,或者如果您的团队需要预留容量,请联系我们洽谈专属部署。

来源:Baseten Blog · baseten.co