跳到正文
Ahead of AI· Sebastian Raschka, PhD·· 2025-12-03精选AI 评分78

从 DeepSeek V3 到 V3.2:架构、稀疏注意力与强化学习更新

From DeepSeek V3 to V3.2: Architecture, Sparse Attention, and RL Updates

AI 导读

Sebastian Raschka 撰文梳理 DeepSeek 从 V3 到 V3.2 的技术演进,重点分析 V3.2 沿用 V3.2-Exp 架构并引入 DeepSeek Sparse Attention(DSA),通过 lightning indexer 与 token selector 将注意力复杂度从 O(L²) 降到 O(Lk),k 在代码中设为 2048。

推荐理由

梳理 DeepSeek 从 V3 到 V3.2 的架构与训练演进,可对照理解稀疏注意力和 RLVR 的具体改动。

正文 · AI 翻译

译文尚不完整,完整内容请切换到原文。

最后更新:2026年1月1日

与 DeepSeek V3 类似,该团队在美国一个重要节假日周末发布了他们的新旗舰模型。鉴于 DeepSeek V3.2 的表现确实出色(达到 GPT-5 和 Gemini 3.0 Pro 的水平),而且它还是以开放权重模型的形式提供,绝对值得仔细研究。

图 1:DeepSeek V3.2 与专有旗舰模型的基准对比。这是来自 DeepSeek V3.2 报告的标注图。

我在 The Big LLM Architecture Comparison 一文的最开头就介绍过其前身 DeepSeek V3,随着新架构的发布,我在几个月里不断扩充那篇文章。本来,我刚和家人过完感恩节假期回来,打算“只是”在文章里再加一节来补充这次 DeepSeek V3.2 的发布,但后来我意识到有太多有趣的信息值得涵盖,于是决定把它写成一篇更长的独立文章。

有很多有趣的内容值得探讨,从他们的技术报告中也有很多东西可以学习,那么让我们开始吧!

1. DeepSeek 发布时间线

虽然 DeepSeek V3 在 2024 年 12 月发布时并未立即走红,但 DeepSeek R1 推理模型(基于完全相同的架构,以 DeepSeek V3 作为基础模型)帮助 DeepSeek 成为最受欢迎的开放权重模型之一,并成为 OpenAI、Google、xAI 和 Anthropic 等专有模型的一个真正替代选择。

图 2:2024 年 12 月的 DeepSeek V3/R1 架构。我们将在后面的章节中重新回顾并讨论架构细节。

那么,自 V3/R1 以来有什么新东西?我相信 DeepSeek 团队今年一直非常忙碌。然而,自 DeepSeek R1 以来的过去 10-11 个月里,并没有重大发布。

就我个人而言,我认为大型 LLM 发布间隔约 1 年是合理的,因为这是巨大的工作量。不过,我在各种社交媒体平台上看到,人们宣称这个团队“已死”(不过是昙花一现)。

我相信 DeepSeek 团队也一直在忙于应对从 NVIDIA 芯片切换到华为芯片的过程。顺便说一句,我与他们没有任何关联,也没有与他们交谈过;这里的一切都基于公开信息。据我所知,他们已经恢复使用 NVIDIA 芯片。

最后,他们也并非什么都没发布。今年陆续有一些较小的发布,例如 DeepSeek V3.1 和 V3.2-Exp。

图 3:自去年以来的 DeepSeek 发布。主要模型以红色显示。

正如我在 9 月预测的那样,DeepSeek V3.2-Exp 的发布旨在让生态系统和推理基础设施准备好承载刚刚发布的 V3.2 模型。

V3.2-Exp 和 V3.2 使用了一种非标准的稀疏注意力变体,需要自定义代码,但关于这一机制的更多内容稍后再谈。(我本想在之前那篇 Beyond Standard LLMs 文章中介绍它,但当时 Kimi Linear 正好发布,我优先把它放进了那篇文章中关于新注意力变体的章节。)

2. 混合式与专用推理模型

在进一步讨论模型细节之前,也许值得先讨论一下整体模型类型。最初,DeepSeek V3 是作为基础模型发布的,而 DeepSeek R1 增加了额外的后训练,以开发出一个专用推理模型。这一过程总结在下图中。

图 4:DeepSeek R1 训练流程概览。此图来自我更详细的 Understanding Reasoning LLMs 文章。

你可以在我的 Understanding Reasoning LLMs 文章中阅读更多关于上图中训练流程的内容。

这里值得注意的是,DeepSeek V3 是一个基础模型,而 DeepSeek R1 是一个专用的推理模型。

与 DeepSeek 并行,其他团队也发布了许多非常强大的开放权重推理模型。今年最强大的开放权重模型之一是 Qwen3。它最初是作为混合推理模型发布的,这意味着用户可以在同一个模型内切换推理和非推理模式。(在 Qwen3 的情况下,这种切换是通过分词器添加/省略 <think></think> 标签来实现的。)

此后,LLM 团队发布了(在某些情况下来回切换于)专用推理模型和 Instruct/Reasoning 混合模型,如下图所示的时间线。

图 5:今年发布的一些推理和混合模型的时间线。

例如,Qwen3 最初是一个混合模型,但 Qwen 团队后来发布了单独的 instruct 和推理模型,因为它们更容易开发,并且在各自的用例中产生了更好的性能。

一些模型,如 OpenAI 的 gpt-oss,只提供混合变体,用户可以通过系统提示选择推理努力程度(我怀疑 GPT-5 和 GPT-5.1 中的处理方式类似)。

而在 DeepSeek 的情况下,看起来他们从专用推理模型(R1)转向了混合模型(V3.1 和 V3.2),方向相反。然而,我怀疑 R1 主要是一个研究项目,用于开发推理方法和当时最好的推理模型。V3.2 的发布可能更多是关于为不同用例开发最佳的整体模型。(在这里,R1 更像是一个测试平台或原型模型。)

我还怀疑,虽然 DeepSeek 团队开发了具有推理能力的 V3.1 和 V3.2,但他们可能仍在开发专用的 R2 模型。

3. 从 DeepSeek V3 到 V3.1

在更详细地讨论新的 DeepSeek V3.2 发布之前,我认为从概述 V3 到 V3.1 的主要变化开始会有所帮助。

3.1 DeepSeek V3 概述与多头潜在注意力(MLA)

我已经在其他几篇文章中详细讨论了 DeepSeek V3 和 R1。总结要点,DeepSeek V3 是一个基础模型,使用了两个值得注意的架构方面:专家混合(MoE)和多头潜在注意力(MLA)。

我想你现在可能已经非常熟悉 MoE 了,所以我在这里跳过介绍。但是,如果你想阅读更多,我推荐我的 The Big Architecture Comparison 文章中的简短概述以获取更多背景信息。

另一个值得注意的亮点是 MLA 的使用。MLA 用于 DeepSeek V2、V3 和 R1,提供了一种节省内存的策略,与 KV 缓存特别搭配。MLA 的思路是,在将键和值张量存储到 KV 缓存之前,将其压缩到较低维度的空间。

在推理时,这些压缩张量在使用前会被投影回原始大小,如下图所示。这增加了一次额外的矩阵乘法,但减少了内存使用。

(顺便说一句,查询也会被压缩,但仅在训练期间,而非推理期间。)

图 6:DeepSeek V3/R1 中的多头潜在注意力(MLA)。(为简洁起见,未展示查询向量的压缩空间。)

上图展示了 MLA 背后的核心思想:键和值首先被投影到一个潜在向量中,随后可将其存储在 KV 缓存中以降低内存需求。这需要之后再进行一次上投影,回到原始的键值空间,但总体而言它提升了效率(打个比方,你可以把它类比为 LoRA 中的降投影和升投影)。

请注意,查询也被投影到一个单独的压缩空间中,与键和值所示的情况类似。不过,为简洁起见,我在上图中省略了它。

顺便提一下,如前所述,MLA 在 DeepSeek V3 中并非新事物,因为其 前代 DeepSeek V2 也使用(甚至引入了)它。

3.2 DeepSeek R1 概述与可验证奖励强化学习(RLVR)

DeepSeek R1 使用与上述 DeepSeek V3 相同的架构。区别在于训练配方。也就是说,以 DeepSeek V3 作为基础模型,DeepSeek R1 专注于可验证奖励强化学习(RLVR)方法,以提升模型的推理能力。

RLVR 的核心思想是让模型从可以通过符号化或程序化方式验证的响应中学习,例如数学和代码(当然,这也可以扩展到这两个领域之外)。

图 7:一个可验证任务的示例。

GRPO 算法,全称为组相对策略优化(Group Relative Policy Optimization),本质上是近端策略优化(PPO)算法的一个更简单的变体,后者在基于人类反馈的强化学习(RLHF)中很流行,用于 LLM 对齐。

图 8:LLM 训练中强化学习设置的比较。使用 PPO 的传统 RLHF 同时使用奖励模型(基于人类偏好训练)和评论家(价值模型)来指导学习。GRPO 去掉了评论家模型。使用 GRPO 的 RLVR 更进一步,去掉了奖励模型,转而依赖来自符号工具(如计算器或编译器)的可验证奖励。

如果你有兴趣了解更多信息,我在我的 The State of Reinforcement Learning for LLM Reasoning 中更详细地介绍了使用其 GRPO 算法的 RLVR 训练(包括其背后的数学原理)。

3.3 DeepSeek R1-0528 版本升级

正如 DeepSeek 团队自己所说,DeepSeek R1-0528 基本上是一次“小版本升级”。

架构与 DeepSeek V3/R1 保持一致,改进在于训练方面,使其在当时能够与 OpenAI o3 和 Gemini 2.5 Pro 相媲美。

遗憾的是,DeepSeek 团队没有发布任何具体信息来描述这是如何实现的;不过,他们表示这在一定程度上来自其后训练流程的优化。此外,根据已分享的信息,我认为该模型的托管版本很可能在推理时使用了更多计算资源(更长的推理)。

3.4 DeepSeek V3.1 混合推理

DeepSeek V3.1 是一个混合模型,同时具备通用聊天(指令)和推理能力。也就是说,不再是开发两个独立的模型,现在只有一个模型,用户可以通过聊天提示模板切换模式(类似于最初的 Qwen3 模型)。

DeepSeek V3.1 基于 DeepSeek V3.1-Base,而后者又基于 DeepSeek V3。它们都共享相同的架构。

4. DeepSeek V3.2-Exp 与稀疏注意力

DeepSeek V3.2-Exp(2025 年 9 月)才是更有意思的地方。

最初,DeepSeek V3.2-Exp 并没有在基准测试中名列前茅,这也是该模型发布时没有引起太多关注的原因。然而,正如我在 9 月所推测的那样,这很可能是一次早期的实验性发布,目的是为更大规模的发布准备好基础设施(尤其是推理和部署工具),因为 DeepSeek V3.2-Exp 中有一些架构上的变化。更大的发布是 DeepSeek V3.2(不是 V4),这个稍后再谈。

那么,DeepSeek V3.2-Exp 有什么新东西?首先,DeepSeek V3.2-Exp 是以 DeepSeek V3.1-Terminus 作为基础模型训练的。什么是 DeepSeek V3.1-Terminus?它只是对上一节提到的 DeepSeek V3.1 检查点做了一点小改进。

技术报告指出:

DeepSeek-V3.2-Exp,一个实验性的稀疏注意力模型,通过持续训练为
DeepSeek-V3.1-Terminus 配备了 DeepSeek 稀疏注意力(DSA)。借助 DSA——一种由闪电索引器驱动的细粒度稀疏注意力机制——DeepSeek-V3.2-Exp 在训练和推理方面都实现了显著的效率提升,尤其是在长上下文场景中。

如上段所述,这里的主要创新是 DeepSeek 稀疏注意力(DSA)机制,他们在对该检查点进行进一步训练之前将其添加到 DeepSeek V3.1-Terminus 中。

这个 DSA 由 (1) 一个闪电索引器和 (2) 一个 token 选择器组成,目标是选择性地缩减上下文以提高效率。

为了解释其工作原理,让我们从滑动窗口注意力开始。例如,滑动窗口注意力是一种将注意力窗口限制为固定大小的技术(最近被 Gemma 3 和 Olmo 3 使用),如下图所示。

图 9:在滑动窗口注意力中,当前查询 token 并不关注所有先前的 token,而只是关注其中的一个子集。

DSA 基于与滑动窗口注意力相同的思路:只能关注过去 token 的一个子集。然而,DSA 不是通过固定宽度的滑动窗口来选择可关注的 token,而是有一个索引器和一个 token 选择器来决定哪些过去的 token 可以被关注。换句话说,可关注的 token 更加随机,如下图所示。

图 10:在 DSA 中,当前 token 可以关注过去选定数量的 token(而不是像常规因果注意力那样关注所有 token)。

然而,虽然我上面说了“随机”,但哪些过去 token 被选中的模式实际上并不是随机的,而是学习得到的。

在实践中,DSA 使用其所谓的闪电索引器,基于所有先前的 token 为每个新的查询 token 计算相关性分数。对于这个计算,闪电索引器使用 DeepSeek 多头潜在注意力(MLA)中的压缩 token 表示,并计算该 token 与其他 token 的相似度。相似度分数基本上就是查询向量和键向量之间经过 ReLU 函数的缩放点积。

如果你对数学细节感兴趣,这个闪电索引器相似度分数的公式(取自论文)如下所示:

这里,w 是一个学习得到的逐头加权系数,决定每个索引器头应对最终相似度分数贡献多少。q 指查询,k 指键向量。下面是不同下标的列表:

  • t:当前查询 token 的位置;

  • s:序列中先前 token 的位置(0 ≤ s < t);

  • j:不同索引器头的索引(上图 10 为简化只展示了一个头),因此 qt, j 表示“索引器头 j 中当前 token t 的查询向量”。

你可能会注意到,索引器只作用于查询,而不作用于键。这是因为模型只需要决定每个新查询应考虑哪些过去的 token。键已经被压缩并存储在 KV 缓存中,因此索引器无需在不同头上再次对它们进行评分或压缩。

这里的 ReLU 函数,由于它是 f(x) = max(x, 0),会将负的点积位置置零,理论上可以实现稀疏性,但由于对不同头进行了求和,索引器得分实际上不太可能为 0。稀疏性更多来自单独的分词选择器。

单独的分词选择器只保留少量高分 token(例如前 k 个位置),并构建一个稀疏注意力掩码,将未被包含在所选子集中的其他 token 掩蔽掉。(前 k 中的 k,不要与上式中用于键的 k 混淆,是一个超参数,在 DeepSeek 团队分享的 模型代码 中设置为 2048。)

下图以流程图形式展示了整个过程。

图 11:DeepSeek V3.2 稀疏注意力机制的视觉总结。

总而言之,索引器和分词选择器使每个 token 只关注模型已学会认为最相关的少数过去 token,而不是所有 token 或固定的局部窗口。

这里的目标不是提高相对于 DeepSeek V3.1-Terminus 的性能,而是在受益于效率提升的同时,减少(由于稀疏注意力机制导致的)性能下降。

总体而言,DSA 将注意力机制的计算复杂度从二次 O(𝐿2)(其中 L 是序列长度)降低到线性 O(𝐿𝑘),其中 𝑘(≪𝐿)是所选 token 的数量。

5. 具有自我验证和自我改进的 DeepSeekMath V2

讨论完 DeepSeek V3.2-Exp 后,我们离本文的主题——DeepSeek V3.2——越来越近了。不过,还有一块拼图需要先讨论。

2025 年 11 月 27 日(美国感恩节),也就是 DeepSeek V3.2 发布前 4 天,DeepSeek 团队发布了基于 DeepSeek V3.2-Exp-Base 的 DeepSeekMath V2。

该模型专为数学开发,在多项数学竞赛中取得了金牌级成绩。本质上,我们可以将其视为 DeepSeek V3.2 的(概念)验证模型,引入了一项新技术。

这里的关键在于,推理模型(如 DeepSeek R1 等)使用外部验证器进行训练,模型自行学习在得出最终答案之前写出解释。然而,这些解释可能是错误的。

正如 DeepSeek 团队简洁指出的,常规 RLVR 的缺点:

[...] 正确的答案并不能保证正确的推理。

[...] 模型可能通过有缺陷的逻辑或侥幸的错误得出正确答案。

他们旨在解决的 DeepSeek R1 RLVR 方法的另一个局限是:

[...] 许多数学任务,如定理证明,需要严格的逐步推导,而非数值答案,这使得最终答案奖励不适用。

因此,为了改进上述两个缺点,在本文中,他们训练了两个模型:

  1. 一个基于 LLM 的定理证明验证器。

  2. 主模型,即证明生成器,使用基于 LLM 的验证器作为奖励模型(而不是符号验证器)。

除了上述通过 LLM 进行的自我验证外,他们还使用自我改进(在我即将出版的《从零构建推理模型》一书第 5 章中介绍)让 LLM 迭代改进自己的答案。

5.1 自我验证

让 LLM 对中间步骤进行评分并不新鲜。有一整条关于所谓过程奖励模型的研究路线一直专注于这一点。例子包括 用过程和结果反馈解决数学应用题(2022) 或 让我们逐步验证(2023),但还有更多。

过程奖励模型的挑战在于,检查中间奖励是否正确并不容易,而且它还可能导致奖励黑客。

在 2025 年 1 月的 DeepSeek R1 论文中,他们没有使用过程奖励模型,因为他们发现:

在我们的实验中,与大规模强化学习过程中引入的额外计算开销相比,其优势有限。

在本文中,他们以自我验证的形式成功重新审视了这一点。其动机是,即使不存在参考解,人类在阅读证明并发现问题时也能自我纠正。

因此,为了开发一个更好的数学证明写作模型(下图中 LLM 1),他们开发了下图中的证明验证器(LLM 2),可用作 LLM 作为评判者来为证明器(LLM 1)的输出评分。

图 12:通用数学证明生成器(LLM 1)和验证器(LLM 2)设置。

验证器 LLM(LLM 2)接收一个评分标准来为生成的证明评分,其中分数为

  • “1 表示完整且严谨的证明,所有逻辑步骤都有清晰论证;”

  • “0.5 表示整体逻辑合理但存在小错误或遗漏细节的证明;”

  • “0 表示存在致命逻辑错误或关键缺口的根本性缺陷证明。”

对于证明验证器模型,他们从 DeepSeek V3.2-Exp-SFT 开始,这是他们基于 DeepSeek V3.2-Exp 通过在推理数据(数学和代码)上进行监督微调而创建的模型。然后,他们使用格式奖励(检查解决方案是否采用预期格式)和基于预测分数与实际分数(由人类数学专家标注)接近程度的分数奖励,通过强化学习进一步训练该模型。

证明验证器(LLM 2)的目标是检查生成的证明(LLM 1),但谁来检查证明验证器?为了使证明验证器更稳健并防止其幻觉出问题,他们开发了第三个 LLM,即元验证器。

图 13:元验证器(LLM 3)检查验证器(LLM 2)是否正确验证生成器(LLM 1)。

元验证器(LLM 3)也像 LLM 2 一样通过强化学习开发。虽然元验证器的使用并非必需,但 DeepSeek 团队报告称:

验证器证明分析的平均质量分数——由元验证器评估——从 0.85 提高到 0.96,同时在证明分数预测上保持相同的准确率。

这其实是一个相当有趣的设定。如果你熟悉生成对抗网络(GAN),你可能会在这里看到类比。例如,证明验证器(可以把它看作 GAN 的判别器)改进证明生成器,而证明生成器生成更好的证明,进一步推动证明验证器。

元分数在验证器(LLM 2)和生成器(LLM 1)的训练过程中使用。它不会在自精炼循环的推理阶段使用,我们将在下一节讨论这一点。

5.2 自精炼

在上一节中,我们讨论了自验证,即分析解决方案的质量。这样做的目的是实现自精炼,这意味着 LLM 可以根据反馈采取行动并修改其答案。

传统上,在自精炼中——这是一种成熟且流行的推理扩展技术——我们会使用同一个 LLM 来生成解决方案并验证它,然后再进行精炼。换句话说,在前面的图 12 和图 13 中,LLM 1 和 LLM 2 会是同一个 LLM。因此,传统的自精炼过程如下所示:

图 14:经典的自精炼迭代,我们使用同一个 LLM 来生成初始响应(输出 1)、评估(Eval)和精炼后的答案(输出 2)。

然而,DeepSeek 团队在实践中观察到,使用同一个 LLM 同时进行生成和验证存在一个关键问题:

当被提示一次性生成并分析自己的证明时,生成器倾向于声称其正确性,即使外部验证器很容易识别出缺陷。换句话说,虽然生成器可以根据外部反馈精炼证明,但它无法像专门的验证器那样严格地评估自己的工作。

作为一个合乎逻辑的结果,人们会认为他们使用单独的证明生成器(LLM 1)和证明验证器(LLM 2)。因此,这里使用的自精炼循环变得类似于下图所示。请注意,我们省略了 LLM 3,它仅在验证器(LLM 2)的开发过程中使用。

图 15:使用单独验证器 LLM(LLM 2)的自精炼。

然而,在实践中,与图 15 不同,DeepSeek 团队使用了与图 14 中经典自精炼循环相同的生成器和验证器 LLM:

“所有实验都使用了单一模型,即我们最终的证明生成器,它同时执行证明生成和验证。”

换句话说,单独的验证器对于训练至关重要,用于改进生成器,但一旦生成器足够强大,在后续推理中就不再使用(/需要)它。与朴素单模型自精炼的关键区别在于,最终的证明器是在更强的验证器和元验证器的指导下训练的,因此它已经学会了将这些评分标准应用于自己的输出。

此外,在推理期间使用这种二合一的 DeepSeekMath V2 验证器在资源和成本方面也有好处,因为它比运行第二个 LLM 进行证明验证增加了更少的复杂性和计算需求。

回到图 14 和图 15 中展示的一般自精炼概念,两图都展示了具有 2 次迭代的自精炼(初始答案和精炼后的答案)。当然,我们可以向此过程添加更多迭代。这是一个经典的推理扩展权衡:我们添加的迭代越多,生成答案的成本就越高,但整体准确率也越高。

在论文中,DeepSeek 团队使用了多达 8 次迭代,而且看起来准确率尚未饱和。

图 16:额外的自我精炼迭代提升了准确率。该图标注自 DeepSeekMath V2 论文。Best@32 准确率多数投票方法也被称为“自一致性”,在我的 Build a Reasoning Model (From Scratch) 一书第 4 章中有介绍。

6. DeepSeek V3.2(2025 年 12 月 1 日)

我们在上一节花这么多时间讨论 DeepSeekMath V2 的原因是:a) 它是一个非常有趣的概念验证,通过自我验证和自我精炼技术进一步推进了可验证奖励强化学习(RLVR)的理念;b) 自我验证和自我精炼技术也被用于 DeepSeek V3.2。

但在进入这部分之前,让我们先对 DeepSeek V3.2 做一个总体概述。这个模型意义重大,因为它与当前的旗舰模型相比表现非常出色。

图 17:DeepSeek V3.2 与专有旗舰模型的基准比较。这是标注自 DeepSeek V3.2 报告的图。

Similar to several other DeepSeek models, V3.2 comes with a nice technical report, which I will discuss in the next sections.

6.1 DeepSeek V3.2 架构

这个模型的主要动机当然是提升整体模型性能。例如,与 DeepSeekMath V2 一样,它在数学基准上达到了金牌级表现。然而,该模型在训练时也考虑了工具使用,并且在其他任务上也表现良好,例如代码和智能体任务。

与此同时,DeepSeek 团队将计算效率写为一个重要的驱动因素。这就是为什么他们使用了来自 V2 和 V3 的多头潜在注意力(MLA)机制,以及他们在 V3.2 中加入的 DeepSeek 稀疏注意力(DSA)机制。事实上,论文称“DeepSeek-V3.2 使用的架构与 DeepSeek-V3.2-Exp 完全相同”,我们在前面的章节中讨论过这一点。

图 18:DeepSeek V3.2 架构。

正如我之前提到的,DeepSeek V3.2-Exp 的发布很可能是为了让生态系统和推理基础设施准备好托管刚刚发布的 V3.2 模型。

图 19:得益于 DeepSeek 稀疏注意力(DSA)的推理成本节省。标注自 DeepSeek V3.2 报告的图。

有趣的是,如上面论文截图所示,DeepSeek 团队重新使用了 NVIDIA 芯片(此前据称他们曾尝试在华为芯片上进行模型训练)。

由于架构与 DeepSeek V3.2-Exp 相同,有趣的细节在于训练方法,我们将在接下来的章节中讨论。

6.2 强化学习更新

总体而言,DeepSeek 团队采用了与 DeepSeek R1 类似的可验证奖励强化学习(RLVR)流程,使用组相对策略优化(GRPO)算法。然而,有一些有趣的更新值得讨论。

最初,DeepSeek R1 使用了

  • 格式奖励(确保答案格式正确);

  • 语言一致性奖励(这样模型在撰写回答时不会在不同语言之间切换);

  • 以及主要的验证器奖励(数学或代码问题中的答案是否正确)

对于 DeepSeek V3.2,他们更改了奖励:

对于推理和智能体任务,我们采用基于规则的结果奖励、长度惩罚和语言一致性奖励。对于通用任务,我们采用生成式奖励模型,其中每个提示都有各自的评估标准。

例如,他们移除了格式奖励,但为智能体任务添加了长度惩罚。然后,对于没有符号验证器(数学)或代码解释器来验证答案的通用任务,他们使用奖励模型(另一个经过训练以输出奖励分数的 LLM)。

所以,听起来这个流程不再像 DeepSeek R1 那样纯粹基于验证器的 RLVR,而是 RLVR(用于可验证领域)与更标准的 LLM 作为评判者的奖励建模的混合体,适用于其他所有情况。

对于数学领域,他们表示还“纳入了 DeepSeekMath-V2 的数据集和奖励方法”,我们在本文前面已经讨论过这一点。

6.3 GRPO 更新

关于 GRPO 本身,即 RLVR 流程中的学习算法,自 DeepSeek R1 论文中的原始版本以来,他们也做了一些改动。

在过去几个月里,已有数十篇论文提出了对 GRPO 的修改,以提高其稳定性和效率。今年早些时候,我在我的《LLM 推理强化学习现状》一文中介绍了两种流行的方案:DAPO 和 Dr. GRPO。

不深入 GRPO 的数学细节,简而言之,DAPO 通过非对称裁剪、动态采样、token 级损失和显式的基于长度的奖励塑形来修改 GRPO。Dr. GRPO 则修改了 GRPO 目标本身,去除了长度和标准差归一化。

最近的 Olmo 3 论文也采用了类似的改动,我引用如下:

  • 零梯度信号过滤:我们移除奖励完全相同的实例组(即优势标准差为零的批次),以避免在提供零梯度的样本上训练,类似于 DAPO(Yu et al., 2025)。[DAPO]

  • 主动采样:尽管进行了零梯度过滤,我们仍通过一种新颖且更高效的动态采样版本保持一致的批次大小(Yu et al., 2025)。详见 OlmoRL Infra。[DAPO]

  • Token 级损失:我们使用 token 级损失,按批次中 token 的总数来归一化损失(Yu et al., 2025),而不是按样本归一化,以避免长度偏差。[DAPO]

  • 无 KL 损失:我们按照常见做法移除了 KL 损失(GLM-4.5 Team et al., 2025; Yu et al., 2025; Liu et al., 2025b),因为它允许更少限制的策略更新,并且移除它不会导致过度优化或训练不稳定。[DAPO 和 Dr. GRPO]

  • 更高裁剪:我们将损失中的上界裁剪项设置为略高于下界的值,以便对 token 进行更大的更新,如 Yu et al. (2025) 所提出。[DAPO]

  • 截断重要性采样:为了调整推理引擎和训练引擎对数概率之间的差异,我们按照 Yao et al. (2025) 的方法,将损失乘以截断重要性采样比率。

  • 无标准差归一化:在计算优势时,我们不像 Liu et al. (2025b) 那样按组的标准差进行归一化。这消除了难度偏差,即奖励标准差较低的问题(例如太难或太简单)其优势会被归一化项显著放大。[Dr. GRPO]

DeepSeek V3.2 中的 GRPO 修改没有那么激进,我以类似 Olmo 3 的风格进行了总结:

  • 领域特定的 KL 强度(数学领域为零):DAPO 和 Dr. GRPO 在数学类 RL 中总是丢弃 KL,而 DeepSeek V3.2 不同,它在目标中保留了 KL 项,但按领域调整其权重。不过他们也指出,对于数学,非常弱甚至为零的 KL 往往效果最好。(但不是完全移除它,而是将其变为一个超参数。)

  • 无偏 KL 估计:如上所述,DeepSeek V3.2 没有移除 KL 惩罚。除了将其作为调优旋钮之外,他们还提出了一种修正 GRPO 中 KL 惩罚估计方式的方法:用与主损失相同的重要性比率对 KL 项重新加权,使 KL 梯度真正匹配样本来自旧策略而非当前策略这一事实。

  • 离策略序列掩码:当他们跨多个梯度步骤重用 rollout 数据(rollout 只是模型生成的完整序列的术语)时,DeepSeek V3.2 会衡量当前策略在每个完整答案上与 rollout 策略的偏离程度,并直接丢弃那些既有负优势又“过于离策略”的序列。因此,这防止模型从过度离策略或陈旧的数据中学习。

  • 为 MoE 模型保留路由:对于混合专家骨干网络,他们记录 rollout 期间激活了哪些专家,并在训练期间强制使用相同的路由模式,因此梯度更新针对的是那些产生采样答案的专家。

  • 为 top-p / top-k 保留采样掩码:当 rollout 使用 top-p 或 top-k 采样时,DeepSeek V3.2 会存储选择掩码,并在计算 GRPO 损失和 KL 时重新应用它,使训练时的动作空间与采样时实际可用的动作空间相匹配。

  • 保留原始 GRPO 优势归一化:Dr. GRPO 表明,GRPO 的长度和每组标准差归一化项会使优化偏向过长的错误答案,并过度加权非常简单或非常难的问题。Dr. GRPO 通过移除这两项并回到无偏的 PPO 风格目标来修正这一点。相比之下,DAPO 转向 token 级损失,这也改变了长答案与短答案的加权方式。然而,DeepSeek V3.2 保留了原始 GRPO 归一化,转而专注于其他修正,例如上述那些。

因此,总体而言,DeepSeek V3.2 比一些其他近期模型更接近原始 GRPO 算法,但增加了一些逻辑上的调整。

6.4 DeepSeek V3.2-Speciale 与扩展思考

DeepSeek V3.2 还有一个极端的扩展思考变体,称为 DeepSeek V3.2-Speciale,它在 RL 阶段仅使用推理数据进行训练(更类似于 DeepSeek R1)。除了仅使用推理数据训练外,他们还降低了 RL 期间的长度惩罚,允许模型输出更长的响应。

生成更长的回复是一种推理扩展(inference scaling)形式,由于长度增加,回复的成本更高,但能换来更好的结果。

图 20:“扩展思考”Special 模型实现了更高的准确率,但也会生成更多 token。

7. 结论

在本文中,我并未涵盖 DeepSeek V3.2 训练方法的全部细节,但我希望与之前 DeepSeek 模型的对比能帮助阐明要点和创新之处。

简而言之,有趣的要点如下:

  • DeepSeek V3.2 使用了与自 DeepSeek V3 以来所有前代相似的架构;

  • 主要的架构调整是他们加入了来自 DeepSeek V3.2-Exp 的稀疏注意力机制以提高效率;

  • 为了提升数学性能,他们采用了 DeepSeekMath V2 中的自验证方法;

  • 训练流程有多项改进,例如 GRPO 稳定性更新(注意,论文还深入探讨了蒸馏、长上下文训练、类似 gpt-oss 的工具使用集成等其他方面,本文未涉及)。

无论 DeepSeek 模型相对于其他更小的开放权重模型或 GPT-5.1、Gemini 3.0 Pro 等专有模型的市场份额如何,有一点是肯定的:DeepSeek 的发布总是很有趣,而且随开放权重模型检查点一同发布的技术报告总有大量值得学习的内容。

希望你觉得这篇概述有用!

8. DeepSeek 的 mHC:流形约束超连接

Transformer 架构中的效率与性能调整通常(曾)集中在归一化、注意力和 FFN 模块上。
例如:

  • 归一化:LayerNorm → RMSNorm → Dynamic TanH

  • 注意力:分组查询注意力、滑动窗口、多头潜在注意力、稀疏注意力

  • FFN:GeLU → SiLU,SiLU → SwiGLU,混合专家(Mixture of Experts)。

2025 年 12 月 31 日,DeepSeek 分享了关于改进残差路径的新研究:mHC:流形约束超连接。


简而言之,它建立在超连接(HC)方法之上,该方法通过多个并行残差流拓宽残差流,并允许信息在这些并行层之间混合,从而将常规(恒等)残差连接泛化为可学习的连接。

随后他们进一步推进 HC 思路,提出了 mHC,将残差混合约束在一个结构化的、保范的流形上。他们发现这种“m”修改提升了训练稳定性。
这会增加少量开销,但他们获得了更好的训练稳定性和收敛性。

图 21:mHC 方法示意图。右侧子图是来自mHC 论文的标注图。

本杂志是一个个人热情项目,你的支持帮助它维持下去。

如果你想支持我的工作,请考虑我的书《从零构建大语言模型》或其续作《从零构建推理模型》。(我相信你会从中收获很多;它们深入解释了 LLM 的工作原理,这是你在别处找不到的。)

感谢阅读,也感谢你支持独立研究!

《从零构建大语言模型》现已在Amazon上架。《从零构建推理模型》已在Manning 早期访问中提供。

如果你读过这本书,并且能抽出几分钟时间,我将非常感谢你写一篇简短书评。这对我们作者帮助很大!

你的支持意义重大!谢谢!

来源:Ahead of AI · magazine.sebastianraschka.com