跳到正文
Hugging Face Blog·· 2023-11-07AI 评分36

用 AWS Inferentia2 加速 Llama 2 文本生成

Make your llama generation time fly with AWS Inferentia2

AI 导读

Hugging Face 的 optimum-neuron 现已支持在 AWS Inferentia2 上部署 Llama 2 等 LLM 进行文本生成。用户可将 Llama-2-7b-hf 编译导出为 Neuron 格式,并选择 budget、latency、throughput 等不同配置,其中 7B 与 13B 模型均提供预编译版本,最大序列长度为 2048。

来源:Hugging Face Blog · huggingface.co