ik_llama.cpp 分支加入 MoE 优化
热点事件持续更新
ik_llama.cpp 分支加入 MoE 优化
1 篇报道1 个报道来源4 小时前更新
先了解这件事
AI 综述
2026年10月6日,开发者 IceFog72 在 r/LocalLLaMA 发布 ik_llama.cpp 分支,为 MoE 模型加入带宽自适应 CPU/GPU 混合执行、可配置专家驻留显存上限(--moe-resident-mib N)以及 Q2_0 量化支持。据其说明,若不指定 --moe-resident-mib N,--moe-resident auto 会用尽所有可用空闲显存驻留专家;该优化仅在完整 MoE 无法放入显存、GPU 仍有未用算力且 PCIe 总线空闲时才有帮助,若 GPU 已满载则可能没有提升。开发者还表示因硬件限制无法正确测试 -ncmoe 的行为。目前进展停留在发布与条件说明阶段。
AI 根据报道生成 · 2 小时前更新
最新进展10月6日 07:33
k_llama.cpp 分支为 MoE 模型加入专家驻留与 CPU/GPU 混合执行优化报道时间线
沿着报道,了解事件的不同侧面。
10月6日
- r/LocalLLaMAk_llama.cpp 分支为 MoE 模型加入专家驻留与 CPU/GPU 混合执行优化
开发者 IceFog72 发布 k_llama.cpp 分支,为 MoE 模型加入带宽自适应 CPU/GPU 混合执行、可配置专家驻留显存上限(--moe-resident-mib N)和 Q2_0 量化支持。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。