Hugging Face Blog·· 2023-12-11AI 评分52
Hugging Face 详解混合专家模型 MoE
Mixture of Experts Explained
AI 导读
Hugging Face 发布《Mixture of Experts Explained》长文,系统讲解 MoE 的构成、训练方式与推理权衡。文章指出 MoE 用稀疏层加门控网络替代部分 FFN 层,预训练更快、推理比同参数量稠密模型更快,但需把全部专家载入显存,例如 Mixtral 8x7B 需容纳 47B 稠密参数。
来源:Hugging Face Blog · huggingface.co