用户实测 ik_llama.cpp 与主线 llama.cpp 多 GPU 性能
热点事件持续更新
用户实测 ik_llama.cpp 与主线 llama.cpp 多 GPU 性能
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026 年 10 月 7 日,r/LocalLLaMA 用户 /u/vulcan4d 发布对比测试,比较 ik_llama.cpp 与主线 llama.cpp 在混合多 GPU 机器上的推理性能。据其描述,测试将 35 层卸载到 4 块 GPU(-ngl 35),其余 13 层由 AVX-512 CPU 计算,上下文为 32k;Pascal 显卡需严格控制在 9.7 GB 显存以内,超出会触发 PCIe 微分页并拖慢速度;主线使用 --poll 100 以避免 AVX-512 CPU 线程在 GPU 层交接间进入低功耗休眠。该用户称,每次与主线 ggml-org 对比,主线都以较大幅度胜出:主线 prompt eval 为 19.70 tokens/sec、生成 10.86 tokens/sec,ik_llama.cpp 分别为 5.48 和 8.43 tokens/sec。其还提到 ik_llama.cpp 在生成期间会花时间做上下文检查点(100ms 以上停顿),且不支持 --poll。以上均为该用户单次实测的说法。
AI 根据报道生成 · 48 分钟前更新
最新进展10月7日 10:17
为什么说 ik_llama.cpp 比主线 llama.cpp 更快?在混合多 GPU 机器上主线反而大幅胜出报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- r/LocalLLaMA为什么说 ik_llama.cpp 比主线 llama.cpp 更快?在混合多 GPU 机器上主线反而大幅胜出
有用户在 4 卡混合多 GPU 机器上实测,主线 llama.cpp 以 19.70 tokens/sec 的 prompt eval 和 10.86 tokens/sec 的生成速度,大幅领先 ik_llama.cpp 的 5.48 和 8.43 tokens/sec。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。