跳到正文
热点事件持续更新

ik_llama.cpp 分支加入 MoE 优化

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026年10月6日,开发者 IceFog72 在 r/LocalLLaMA 发布 ik_llama.cpp 分支,为 MoE 模型加入带宽自适应 CPU/GPU 混合执行、可配置专家驻留显存上限(--moe-resident-mib N)以及 Q2_0 量化支持。据其说明,若不指定 --moe-resident-mib N,--moe-resident auto 会用尽所有可用空闲显存驻留专家;该优化仅在完整 MoE 无法放入显存、GPU 仍有未用算力且 PCIe 总线空闲时才有帮助,若 GPU 已满载则可能没有提升。开发者还表示因硬件限制无法正确测试 -ncmoe 的行为。目前进展停留在发布与条件说明阶段。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. r/LocalLLaMA
    k_llama.cpp 分支为 MoE 模型加入专家驻留与 CPU/GPU 混合执行优化

    开发者 IceFog72 发布 k_llama.cpp 分支,为 MoE 模型加入带宽自适应 CPU/GPU 混合执行、可配置专家驻留显存上限(--moe-resident-mib N)和 Q2_0 量化支持。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。