vLLM 宣布 Day-0 支持 Qwen3.8-2.4T-A95B
Day 0 Support for Qwen3.8-2.4T-A95B on vLLM
vLLM 宣布在 Qwen3.8-2.4T-A95B 发布当天提供 Day-0 支持,该模型复用 Qwen 3.5 架构,无需改动即可在 vLLM 上运行。这是一个 2.4 万亿参数的稀疏 MoE 模型,含 512 个专家、92 层混合骨干,每 4 层应用一次全注意力,其余 69 层为线性注意力。
vLLM 在 Qwen3.8 开源权重发布当天给出部署方案,并列出 FP4 量化后的基准对比与硬件要求。
我们宣布对 Qwen3.8-2.4T-A95B 提供 Day-0 vLLM 支持。这是 Qwen 家族中首个将 Qwen-Max 级模型以开放权重形式发布的模型。
Qwen3.8-2.4T-A95B 基于 Qwen 3.5 架构构建,开箱即可在 vLLM 上运行。除了官方的 FP8 和 BF16 检查点外,Inferact 还发布了 MXFP4 和 NVFP4 量化权重,其质量与全精度相当,同时显著降低了内存和带宽开销。
Qwen3.8-2.4T-A95B 是一个 2.4 万亿参数的稀疏 MoE 模型,拥有 512 个专家。在其 92 层混合骨干网络中,每第 4 层应用完整注意力,其余 69 层运行线性注意力。作为迄今为止发布的最大开放权重模型之一,运行推理至少需要两个 NVIDIA B300 / AMD MI355X 节点(FP4 量化版本则只需单个节点)。
TL;DR
- Day-0 支持:Qwen3.8-2.4T-A95B 复用 Qwen 3.5 架构,从第一天起即可在 vLLM 上运行,无需任何架构更改。
- 灵活的精度:提供 FP8、BF16、NVFP4 和 MXFP4 检查点。
- 多厂商优化:已在包括 NVIDIA 和 AMD 在内的硬件合作伙伴上验证。
快速开始
对于 NVFP4:
# See recipes for the exact docker run command
vllm serve Inferact/Qwen3.8-2.4T-A95B-NVFP4 \
--linear-backend flashinfer_cutedsl \
--tensor-parallel-size 8 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning-parser qwen3 \
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'对于 MXFP4:
vllm serve Inferact/Qwen3.8-2.4T-A95B-MXFP4 \
--tensor-parallel-size 8 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning-parser qwen3 \
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'请参阅 vLLM recipes 获取完整的服务指南和推荐标志。
FP4 量化:以更低成本实现质量
为了最大限度地降低推理成本并最大化 GPU 内存效率,Inferact 团队使用 Round-to-Nearest (RTN) 量化并配合激活校准,将选定层(包括路由专家)量化为 FP4 权重,以实现 4 位激活。
我们进行了初步验证,以确认量化精度保持不变。请注意,复现这些评估结果需要增加推理预算。
| 基准测试 | FP8 | NVFP4 |
|---|---|---|
| GSM8K(严格 / 灵活) | 89.61% / 90.52% | 90.37% / 91.05% |
| AIME25 @3(平均 / 通过) | 87.78% / 93.33% | 92.22% / 96.67% |
优化
为了实现这个 2.4 万亿参数模型的高效推理,我们与 NVIDIA 和 AMD 密切合作,基于现有的 Qwen 3.5 支持开发了优化内核。
在 NVIDIA 平台上,NVIDIA 和 Inferact 共同开发了用于线性注意力(Gated Delta Rule)、注意力(GQA)、密集 GEMM 和 MoE 路由的超快内核。新增了融合内核以减少通信开销。我们还投入了大量精力来确定最佳的工作分解方式以最大化性能,包括将数据并行和張量并行结合用于注意力,以及将专家并行用于 MoE。
在 AMD Instinct GPU 上,vLLM 通过 AITER 融合的 Gated DeltaNet 解码、注意力和 MoE 内核加速 Qwen3.8,减少了内核启动和数据移动开销。对于共享专家 MoE,共享专家路径利用高度优化的 hipBLASLt GEMM 内核,而路由专家则使用 AITER FusedMoE。AMD Quark 量化支持实现了高效的 MXFP4 部署,在保持强大精度的同时大幅降低了模型内存需求。
部署提示
Qwen 3.8 模型卡推荐以下生成参数以获得最佳性能:
temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0
以下是一个 Python 客户端代码片段,用于在 vLLM 服务器运行后查询模型。由于 Qwen 3.8 是一个推理模型,请通过设置较高的 max_tokens 值来为智能体工作流分配足够的 token 预算。
from openai import OpenAI
client = OpenAI(api_key="EMPTY", base_url="http://localhost:8000/v1", timeout=3600)
resp = client.chat.completions.create(
model="Qwen/Qwen3.8-2.4T-A95B",
messages=[{"role": "user", "content": "Give me three primes above 100."}],
temperature=1.0, top_p=0.95, max_tokens=128_000,
)
print(resp.choices[0].message.content)致谢
我们感谢 Qwen 团队发布模型权重以及持续的合作,也感谢我们的硬件合作伙伴 NVIDIA 和 AMD 的联合工程贡献。我们还感谢 Inferact 团队提供量化检查点和端到端的 vLLM 集成,以及更广泛的 vLLM 社区。感谢我们的推理合作伙伴,包括 DigitalOcean、Together AI,他们帮助进行了早期测试。
来源:vLLM Blog · vllm.ai