Hugging Face Blog·· 2025-06-04AI 评分22
nanoVLM 从零实现 KV Cache,生成速度提升 38%
KV Cache from scratch in nanoVLM
AI 导读
Hugging Face 的 nanoVLM 仓库从零实现了 KV Cache,使生成速度提升 38%。nanoVLM 是一个用纯 PyTorch 训练自研视觉语言模型的轻量代码库,KV Cache 在 Attention 块、语言模型和生成循环三处启用,将生成从全序列重算改为增量更新。相关经验可推广到所有自回归语言模型生成。
来源:Hugging Face Blog · huggingface.co