为IBM AC922分叉Strata并优化Qwen3.8推理
热点事件持续更新
为IBM AC922分叉Strata并优化Qwen3.8推理
1 篇报道1 个报道来源12 小时前更新
先了解这件事
AI 综述
2026年10月5日,r/LocalLLaMA 用户 /u/okoyl3 发帖称,其分叉了 Strata 推理引擎,并借助 Opus 5.5 做了大量改动,使其能在其可访问的 IBM AC922 上运行 Qwen3.8-FN UD-Q4_K_XL。据其描述,该机器配备 4 块 16GB GPU,此前用 llama.cpp 效果很差,prefill 仅 130 tk/s、decode 仅 15 tk/s;改用该分支后,prompt 读取峰值达 7,350 tk/s,在 252K token 的 prompt 上仍有 7,090 tk/s(耗时 35 秒),生成峰值约 113 tk/s(JSON),代码约 100 tk/s,散文约 84 tk/s(采用 MTP 投机解码)。其还称全部 72 GiB 专家权重在两个插槽的 RAM 中锁定,GPU 各自以约 70 GB/s 从 NVLink 2.0 拉取数据。上述数字均为该开发者自述,尚无第三方复现。
AI 根据报道生成 · 1 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- r/LocalLLaMA为 IBM AC922 定制的 Strata 分支运行 Qwen3.8-FN UD-Q4_K_XL,prefill 达 7,357 tk/s、decode 达 113 tk/s
开发者基于 Strata 分支并借助 Opus 5.5 改造,使 Qwen3.8-FN UD-Q4_K_XL 在 IBM AC922 上实现最高 7,357 tk/s prefill 和 113 tk/s decode,此前 llama.cpp 仅 130 tk/s prefill、15 tk/s decode。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。