发布稀疏记忆语言模型研究及代码
热点事件持续更新
发布稀疏记忆语言模型研究及代码
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月,用户 fechyyy 在 r/LocalLLaMA 公开了一个稀疏记忆语言模型实验项目。据其介绍,该方案为 21M 参数模型外挂 16.8M 行、6.4B 参数的查表,每个 token 仅使用 33M 参数,效果与同样用 500M Wikipedia token 训练的 114M 稠密模型相当。作者称,将 4-bit 表从 NVMe SSD 内存映射后,模型在其 RX 9070 上仍能以约 140 tok/s 生成,占用 0.4 GB 显存;但从 SSD 读取长提示较慢,每次未命中一行需读取整个 4 KB 页。作者还表示,把该表外挂到已训练完成的模型(Qwen3.5-0.8B)上并未奏效,效果不优于同等算力的小型稠密附加模块。作者自述项目规模很小,大实验只跑了一个随机种子,生成的文本是流利的维基百科式英文但事实为编造。目前该项目已公开研究及代码。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 00:57
21M 模型配 6.4B 参数查表:追平 114M 稠密模型,表可放 SSD报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- r/LocalLLaMA21M 模型配 6.4B 参数查表:追平 114M 稠密模型,表可放 SSD
作者公开了一个稀疏记忆实验:21M 模型外挂 16.8M 行、6.4B 参数的查表,每个 token 只用 33M 参数,效果与同样 500M Wikipedia token 训练的 114M 稠密模型相当。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。