Hugging Face Blog·· 2023-12-05精选AI 评分62
Hugging Face 发布 Optimum-NVIDIA,一行代码加速 LLM 推理
Optimum-NVIDIA Unlocking blazingly fast LLM inference in just 1 line of code
AI 导读
Hugging Face 发布 Optimum-NVIDIA 推理库,只需将 transformers 的 pipeline 导入改为 optimum.nvidia 一行代码,即可在 NVIDIA 平台获得最高 28 倍吞吐提升和 1200 tokens/秒,首 token 延迟最高降低 3.3 倍。
推荐理由
Hugging Face 与 NVIDIA 联合推出的推理库,用一行代码替换即可获得最高 28 倍吞吐提升,适合关注 LLM 部署成本的读者。
来源:Hugging Face Blog · huggingface.co