跳到正文
热点事件持续更新

12GB显存运行Qwen3.8-27B量化方案分享

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月7日,Reddit r/LocalLLaMA 用户 /u/bodhi371 分享了一套在低显存机器上运行 Qwen3.8-27B 的量化部署方案。据其自述,使用 ISTA-DASLab 的 Qwen3.8-27B-GSQ-RCO IQ3_S 量化(约 11GB),在 12GB 显存加 8GB 内存的机器上,解码速度约 18 tok/sec,64k 上下文下预填充约 500-600 tok/sec。作者给出的参考硬件为 9900X + 4070S 12GB + 32GB 内存,使用原版 llama.cpp,启动参数为 -ngl 58 -ot token_embd=CPU -ctk q4_0 -ctv q4_0 -c 64000。作者还称该配方同样适用于 0bserverx 的 Qwen3.8-27B-Heretic-GSQ-RCO IQ3_S 量化,速度相近,约有 7% 的损失。完整的构建与启动脚本及全部测试数据已发布在 GitHub 仓库 bodhi37/Qwen3.8-27B-12GBVRAM-Recipe,供他人复现。上述速度与兼容性均为作者自述,尚未见独立验证。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. r/LocalLLaMA
    Qwen3.8-27B 在 12GB 显存加 8GB 内存下跑到约 18 tok/sec

    作者用 ISTA-DASLab 的 Qwen3.8-27B-GSQ-RCO IQ3_S 量化(约 11GB),在 12GB 显存加 8GB 内存的机器上把 Qwen3.8-27B 跑到约 18 tok/sec 解码、64k 上下文下约 500-600 tok/sec 预填充。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。