跳到正文
NVIDIA Developer Blog· Michelle Horton·· 2026-08-13精选AI 评分82

如何在 NVIDIA GB300 NVL72 上部署 Qwen3.8-2.4T-A95B 并配置推理

Serve Qwen3.8-2.4T-A95B, a 2.4T-Parameter Model, with Configurable Reasoning on NVIDIA GB300 NVL72

AI 导读

NVIDIA 开发者博客介绍如何在 GB300 NVL72 上部署阿里开源的 Qwen3.8-2.4T-A95B(Qwen3.8-Max),并支持可配置推理。该模型总参数 2.4T、每 token 激活 95B,采用细粒度 MoE 架构与全注意力加线性注意力的混合设计,上下文窗口最高 100 万 token。

推荐理由

原文给出在 NVIDIA GB300 NVL72 上部署 Qwen3.8-2.4T-A95B 并配置推理的具体做法,可迁移到同类大 MoE 模型的部署场景。

正文 · AI 翻译

Decorative object.阿里巴巴发布了 Qwen3.8-2.4T-A95B(Qwen3.8-Max)的开放权重,这是其最大的开放权重模型,将接近前沿的能力带到了开放……Decorative object.

阿里巴巴发布了 Qwen3.8-2.4T-A95B(Qwen3.8-Max)的开放权重,这是其最大的开放权重模型,将接近前沿的能力带到了开放生态系统中。它拥有 2.4T 总参数,每个 token 激活 95B。它采用细粒度混合专家(MoE)架构,结合了全注意力和线性注意力,上下文窗口最高可达一百万个 token,输出长度最高可达……

来源

来源:NVIDIA Developer Blog · developer.nvidia.com