跳到正文
Hugging Face Blog·· 2024-08-14AI 评分34

Infini-Attention 复现失败实验:压缩记忆为何越用越差

A failed experiment: Infini-Attention, and why we should keep trying?

AI 导读

Hugging Face 团队复现 Google 的 Infini-Attention 后发现,随着记忆压缩次数增加,模型性能持续下降,该实验被判定为失败。团队认为 ring attention、YaRN 和 rope scaling 仍是扩展预训练模型上下文长度的最佳方案,并开源了训练 checkpoint 供测试。

来源:Hugging Face Blog · huggingface.co