跳到正文
Hugging Face Blog·· 2022-10-12AI 评分34

BLOOM 推理优化实录:延迟降低 5 倍、吞吐提升 50 倍

Optimization story: Bloom inference

AI 导读

Hugging Face 分享了 BLOOM(176B 参数、bf16 下 352GB)推理服务的优化过程,数周内将延迟降低 5 倍、吞吐提升 50 倍。团队先用 Megatron-Deepspeed 训练,再由 Younes 耗时近一个月、200 次 commit 移植到 transformers,并借助 accelerate 的 device_map="auto" 做流水线并行分片。

来源:Hugging Face Blog · huggingface.co