跳到正文
热点事件持续更新

用户实测 ik_llama.cpp 与主线 llama.cpp 多 GPU 性能

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026 年 10 月 7 日,r/LocalLLaMA 用户 /u/vulcan4d 发布对比测试,比较 ik_llama.cpp 与主线 llama.cpp 在混合多 GPU 机器上的推理性能。据其描述,测试将 35 层卸载到 4 块 GPU(-ngl 35),其余 13 层由 AVX-512 CPU 计算,上下文为 32k;Pascal 显卡需严格控制在 9.7 GB 显存以内,超出会触发 PCIe 微分页并拖慢速度;主线使用 --poll 100 以避免 AVX-512 CPU 线程在 GPU 层交接间进入低功耗休眠。该用户称,每次与主线 ggml-org 对比,主线都以较大幅度胜出:主线 prompt eval 为 19.70 tokens/sec、生成 10.86 tokens/sec,ik_llama.cpp 分别为 5.48 和 8.43 tokens/sec。其还提到 ik_llama.cpp 在生成期间会花时间做上下文检查点(100ms 以上停顿),且不支持 --poll。以上均为该用户单次实测的说法。

AI 根据报道生成 · 48 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. r/LocalLLaMA
    为什么说 ik_llama.cpp 比主线 llama.cpp 更快?在混合多 GPU 机器上主线反而大幅胜出

    有用户在 4 卡混合多 GPU 机器上实测,主线 llama.cpp 以 19.70 tokens/sec 的 prompt eval 和 10.86 tokens/sec 的生成速度,大幅领先 ik_llama.cpp 的 5.48 和 8.43 tokens/sec。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。