NInfer6000 分支在 RTX6000 上跑 Qwen 3.8 Flash Next
热点事件持续更新
NInfer6000 分支在 RTX6000 上跑 Qwen 3.8 Flash Next
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026 年 10 月 6 日,Reddit r/LocalLLaMA 用户 /u/lkarlslund 发布 NInfer 的 fork 版本 NInfer6000,面向 RTX6000 96GB 显卡运行 Qwen 3.8 Flash Next 模型。作者称在理想条件下解码速度达到 400 tg/s,该速度需同时满足非专家权重从 16-bit 降采样至 8-bit、使用 MTP3 与更小的 drafting head 等条件;用户也可选择不做降采样,但会付出性能代价、换来略高质量。该分支同时支持来自 "radixark" 的 NVFP4 量化版本,以及经过后训练、号称“思考更少但结果相同”的 "Swift 1.5" 变体,并支持视觉功能。作者表示是在对该 fork 继续调试后达到这一速度,认为值得分享。目前事件进展仅停留在作者自述的发布与性能数据,尚无第三方复现或独立验证的报道。
AI 根据报道生成 · 2 小时前更新
最新进展10月6日 18:37
NInfer6000 分支在 RTX6000 上跑 Qwen 3.8 Flash Next,达 400 tg/s报道时间线
沿着报道,了解事件的不同侧面。
10月6日
- r/LocalLLaMANInfer6000 分支在 RTX6000 上跑 Qwen 3.8 Flash Next,达 400 tg/s
作者发布 NInfer 的 fork 版本 NInfer6000,面向 RTX6000 96GB 显卡运行 Qwen 3.8 Flash Next,理想条件下解码速度达到 400 tg/s。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。