12GB显存运行Qwen3.8-27B量化方案分享
热点事件持续更新
12GB显存运行Qwen3.8-27B量化方案分享
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月7日,Reddit r/LocalLLaMA 用户 /u/bodhi371 分享了一套在低显存机器上运行 Qwen3.8-27B 的量化部署方案。据其自述,使用 ISTA-DASLab 的 Qwen3.8-27B-GSQ-RCO IQ3_S 量化(约 11GB),在 12GB 显存加 8GB 内存的机器上,解码速度约 18 tok/sec,64k 上下文下预填充约 500-600 tok/sec。作者给出的参考硬件为 9900X + 4070S 12GB + 32GB 内存,使用原版 llama.cpp,启动参数为 -ngl 58 -ot token_embd=CPU -ctk q4_0 -ctv q4_0 -c 64000。作者还称该配方同样适用于 0bserverx 的 Qwen3.8-27B-Heretic-GSQ-RCO IQ3_S 量化,速度相近,约有 7% 的损失。完整的构建与启动脚本及全部测试数据已发布在 GitHub 仓库 bodhi37/Qwen3.8-27B-12GBVRAM-Recipe,供他人复现。上述速度与兼容性均为作者自述,尚未见独立验证。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 07:16
Qwen3.8-27B 在 12GB 显存加 8GB 内存下跑到约 18 tok/sec报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- r/LocalLLaMAQwen3.8-27B 在 12GB 显存加 8GB 内存下跑到约 18 tok/sec
作者用 ISTA-DASLab 的 Qwen3.8-27B-GSQ-RCO IQ3_S 量化(约 11GB),在 12GB 显存加 8GB 内存的机器上把 Qwen3.8-27B 跑到约 18 tok/sec 解码、64k 上下文下约 500-600 tok/sec 预填充。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。