Hugging Face Blog·· 2024-05-16AI 评分58
Hugging Face 在 Transformers 中推出 KV Cache 量化功能
Unlocking Longer Generation with Key-Value Cache Quantization
AI 导读
Hugging Face 在 Transformers 中上线 KV Cache 量化功能,通过降低 KV 缓存精度减少长上下文生成的内存占用,int4 精度下质量与 fp16 接近,int2 则出现明显下降。
来源:Hugging Face Blog · huggingface.co