跳到正文
热点事件持续更新

NInfer6000 分支在 RTX6000 上跑 Qwen 3.8 Flash Next

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026 年 10 月 6 日,Reddit r/LocalLLaMA 用户 /u/lkarlslund 发布 NInfer 的 fork 版本 NInfer6000,面向 RTX6000 96GB 显卡运行 Qwen 3.8 Flash Next 模型。作者称在理想条件下解码速度达到 400 tg/s,该速度需同时满足非专家权重从 16-bit 降采样至 8-bit、使用 MTP3 与更小的 drafting head 等条件;用户也可选择不做降采样,但会付出性能代价、换来略高质量。该分支同时支持来自 "radixark" 的 NVFP4 量化版本,以及经过后训练、号称“思考更少但结果相同”的 "Swift 1.5" 变体,并支持视觉功能。作者表示是在对该 fork 继续调试后达到这一速度,认为值得分享。目前事件进展仅停留在作者自述的发布与性能数据,尚无第三方复现或独立验证的报道。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. r/LocalLLaMA
    NInfer6000 分支在 RTX6000 上跑 Qwen 3.8 Flash Next,达 400 tg/s

    作者发布 NInfer 的 fork 版本 NInfer6000,面向 RTX6000 96GB 显卡运行 Qwen 3.8 Flash Next,理想条件下解码速度达到 400 tg/s。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。