跳到正文
Hugging Face Blog·· 2023-12-05精选AI 评分62

Hugging Face 发布 Optimum-NVIDIA,一行代码加速 LLM 推理

Optimum-NVIDIA Unlocking blazingly fast LLM inference in just 1 line of code

AI 导读

Hugging Face 发布 Optimum-NVIDIA 推理库,只需将 transformers 的 pipeline 导入改为 optimum.nvidia 一行代码,即可在 NVIDIA 平台获得最高 28 倍吞吐提升和 1200 tokens/秒,首 token 延迟最高降低 3.3 倍。

推荐理由

Hugging Face 与 NVIDIA 联合推出的推理库,用一行代码替换即可获得最高 28 倍吞吐提升,适合关注 LLM 部署成本的读者。

来源:Hugging Face Blog · huggingface.co