跳到正文
ChinAI· Jeffrey Ding·· 2026-04-27精选AI 评分78

DeepSeek 发布 V4 模型,1.6 万亿参数 Pro 版主打计算效率

ChinAI #356: DeepSeek as Road Builder [修路人]

AI 导读

DeepSeek 于 4 月 24 日发布 V4 模型,含 1.6 万亿参数的 Pro 版本。据技术报告,V4-Pro 单 token 推理 FLOPs 仅为 DeepSeek-V3.2 的 27%,KV cache 占用为 10%,并支持 100 万 token 上下文窗口。

推荐理由

借两篇虎嗅译文拆解 DeepSeek V4 的效率路线与国产芯片适配进展,可对照理解其技术取舍。

正文 · AI 翻译

来自一个……世界的问候

《危险边缘》在这波连胜期间依然是必看节目

……一如既往,所有往期内容的可搜索存档在这里。请务必在此订阅,以《卫报》/维基百科式的打赏模式支持ChinAI(所有人获得相同内容,但有能力付费者支持所有人获取内容,并为优秀的ChinAI贡献者提供报酬)。

专题翻译:1)DeepSeek被过度低估;2)不要高估英伟达;不要低估DeepSeek

背景:4月24日,DeepSeek发布了备受期待的V4模型(包括1.6万亿参数的Pro版本)。让我们借助两篇虎嗅的译文,剖析此次发布的技术细节及其对中国AI生态的更广泛影响。

要点:DeepSeek的V4展现出接近前沿的能力,但主要突破在于计算效率。根据技术报告,DeepSeek V4-Pro“单token推理FLOPs仅为DeepSeek-V3.2的27%,KV缓存仅为10%”。在其《DeepSeek被过度低估》一文中,宋思航将DeepSeek视为修路人。

  • 顶级模型可支持100万token的上下文窗口,这意味着它们能一次性处理更多信息,相当于5万行代码。V4以极低的计算成本支持这一长上下文窗口。有趣的是,宋指出DeepSeek在这一指标上超越了其他能力强大、性价比高的中国模型:与DeepSeek相比,“面对同样的复杂任务,(月之暗面的)Kimi通常会消耗更多token”。

  • 摘自宋的文章:“它仍然是一家专注于围绕‘效率’这一核心原则构建模型的公司。其混合注意力架构、KV缓存压缩、百万token上下文窗口的推理成本降低、专家并行优化以及跨平台内核设计等功能可能并不特别‘性感’,但它们无疑至关重要。”

DeepSeek与其他中国AI模型有何不同?在技术路线上(见下图),虎嗅认为月之暗面是与DeepSeek最相似的公司。

各公司、模型发布日期及与“注意力机制”相关的创新对照表(即随着上下文窗口增大,如何使计算和内存使用更高效)
  • 部分原因在于它并非传统初创公司(由一家量化对冲基金支持),因此能够进行长周期投资。相比之下,月之暗面的运作更像典型的AI初创公司,面临商业化和融资的现实需求。

  • 需要强调的是,计算效率并非唯一重要的事。例如,Kimi被优化为生产力工具。我认为宋文章中的这一点很有帮助:“如果一个模型多消耗几个token,却能为用户节省三小时工作时间,这种取舍很可能是值得的。”

DeepSeek V4 对中国芯片意味着什么?与一些草率的分析相反,DeepSeek 很可能在训练方面仍依赖英伟达芯片;不过,V4 的一些工具链进展表明,国产替代正在逐步推进,尤其是在推理侧。

  • DeepSeek 并未声称使用华为昇腾芯片训练 V4。相反,V4 很可能是在英伟达芯片上训练的。正如业内人士对 Song 所说:“如果他们真的完全切换到了国产芯片,V4 模型很可能不会这么快就问世。”

  • DeepSeek 技术报告中一个有趣的细节是他们使用了 TileLang 领域特定语言,它与英伟达生态的绑定较少,可以适配多种不同的芯片平台。

  • 虎嗅的另一篇文章,作者是董必政,深入探讨了 DeepSeek V4 对推理的影响。DeepSeek 一直在试验一种独特的“Engram”架构,旨在解决内存容量限制。内存容量是英伟达在训练和推理两方面都如此强大的原因之一:其最新的 Rubin GPU 总内存容量为 288GB(相比之下,昇腾 910B 的内存容量为 64B)。DeepSeek 正试图用更少的内存容量做更多的事。文章写道:“一项通常需要 80GB 显存(视频随机存取存储器)才能执行的长上下文推理任务,在 Engram 架构下可能只需要 8GB。”

  • 董还分享了另一个关于用中国芯片适配 DeepSeek-V4 的细节:“打破行业惯例,开发者没有给英伟达提前测试的机会;相反,他们把所有的早期适配机会专门留给了华为和寒武纪。明确的目标是执行从 CUDA 生态到华为 CANN 框架的全面迁移。”

  • 董的文章还包含一些更多的统计数据和行业报告,渲染了 DeepSeek 对中国国产芯片雄心意味着什么。我持更怀疑的态度(至少在短期内),但 V4 让我印象深刻的是 Engram 架构和 TileLang 的改进,它们似乎具有持久的影响力。

全文翻译:1)DeepSeek 被过度低估;2)不要高估英伟达;不要低估 DeepSeek

*我们下周再补上阅读推荐!

感谢您的阅读和参与。

这些是 Jeff Ding(有时)每周翻译的中文 AI 及相关话题的思考。Jeff 是乔治·华盛顿大学政治学助理教授。

查看所有往期内容的存档在此,并请在此订阅,以《卫报》/维基百科式的打赏模式支持 ChinAI(所有人获得相同内容,但有能力付费订阅的人将为所有人提供支持)。

有任何建议或反馈?请通过 [email protected] 或 Twitter 上的 @jjding99 告诉我

来源:ChinAI · chinai.substack.com