跳到正文
Hugging Face Blog·· 2024-05-16AI 评分58

Hugging Face 在 Transformers 中推出 KV Cache 量化功能

Unlocking Longer Generation with Key-Value Cache Quantization

AI 导读

Hugging Face 在 Transformers 中上线 KV Cache 量化功能,通过降低 KV 缓存精度减少长上下文生成的内存占用,int4 精度下质量与 fp16 接近,int2 则出现明显下降。

来源:Hugging Face Blog · huggingface.co