跳到正文
Hugging Face Blog·· 2025-06-04AI 评分22

nanoVLM 从零实现 KV Cache,生成速度提升 38%

KV Cache from scratch in nanoVLM

AI 导读

Hugging Face 的 nanoVLM 仓库从零实现了 KV Cache,使生成速度提升 38%。nanoVLM 是一个用纯 PyTorch 训练自研视觉语言模型的轻量代码库,KV Cache 在 Attention 块、语言模型和生成循环三处启用,将生成从全序列重算改为增量更新。相关经验可推广到所有自回归语言模型生成。

来源:Hugging Face Blog · huggingface.co