Unsloth 11 月更新:FP8 强化学习、QAT 与 NVIDIA、OpenAI 合作
Unsloth Nov Update
Unsloth 发布 11 月更新,为强化学习引入 FP8 精度训练,使 FP8 GRPO 可在消费级 GPU 上运行,Qwen3-1.7B FP8 GRPO 仅需 5GB 显存。
Unsloth 集中披露 FP8 RL、QAT 与多平台支持等更新,读者可据此判断本地微调与部署的成本变化。
我们即将发布 2025 年的最终版本!非常感谢大家这一年来的支持。我们带来了许多新功能,比如 FP8 RL,以及与 OpenAI、NVIDIA 等的合作!请看下方我们的最新更新:
⚡FP8 强化学习
DeepSeek-R1 展示了 FP8 的强大能力,而更快的 RL 推理至关重要,因为它是工作负载中计算最密集的部分。我们为 RL 引入了 FP8 精度训练,使得 FP8 GRPO 现在可以在消费级 GPU(NVIDIA RTX 40、50 等)上运行。
Qwen3-1.7B FP8 GRPO 现在仅需 5GB 显存即可运行。我们与 PyTorch 合作,使 FP8 RL 推理比 FP16 快约 1.4 倍(在更长上下文下提升更多)。FP8 GRPO 受益于 Unsloth 的权重共享、Flex Attention 等功能,使其显存占用减少 60%,上下文长度比其他实现长 10 倍。
我们还深入研究了使用 FP16 与 BF16 时出现的 RL 奖励不匹配问题,并发现 Unsloth 不存在此问题。
更出色的 Unsloth!
您可能注意到 Unsloth 现在使用的显存比以前少得多,从而支持更长的上下文。我们很快还将实现更快的训练,并会在即将发布的博客中分享所有细节。
🚀 OpenAI DevDay 合作
我们与 OpenAI 合作开发了一个 gpt-oss RL notebook,它使用 RL 自主击败了 2048 游戏。训练是在 NVIDIA DGX Spark 上使用 Unsloth 本地完成的。我们的 notebook 示例在 OpenAI DevDay 2025 上进行了展示。
💚 NVIDIA 支持
NVIDIA DGX Spark:Unsloth 支持在 NVIDIA DGX™ Spark 上本地微调高达 200B 参数的 LLM。凭借 128 GB 统一内存,您可以训练 gpt-oss-120b 等大型模型,并直接在 DGX Spark 上运行或部署推理。
Blackwell / RTX 50 系列:Unsloth 现在支持 NVIDIA 的 Blackwell 架构 GPU,包括 RTX 50 系列 GPU(5060–5090)、RTX PRO 6000,以及 B200、GB100 等 GPU!您可以在官方 NVIDIA 博客文章中阅读我们的合作内容。
🐋 DeepSeek-OCR
DeepSeek-OCR 是一个用于 OCR 和文档理解的 3B 参数视觉模型。它使用上下文光学压缩将 2D 布局转换为视觉 token,从而实现高效的长上下文处理。
微调 DeepSeek-OCR 以增强其视觉或语言性能。在我们的 Unsloth 免费微调 notebook 中,我们展示了语言理解方面 88.26% 的提升。
🎯 量化感知训练(QAT)
我们与 TorchAO 合作,实现了可训练的量化,尽可能恢复精度。与标准的 4 位朴素量化相比,这显著提升了模型质量。
QAT 可以恢复高达 70% 的损失精度,并在 GPQA 和 MMLU Pro 等基准测试上实现 1-3% 的模型性能提升。
🐳 通过 Docker × Unsloth 在本地运行 LLM
您可以在 Mac、Windows 或 Linux 上通过一行代码或完全无需代码运行任何模型,包括 Unsloth Dynamic GGUF。我们与 Docker 合作简化模型部署,Unsloth 现在为 Docker 的大部分 GGUF 模型提供支持。
🔮 Qwen3-VL
Qwen3-VL 是 Qwen 推出的全新视觉模型,包含 instruct 和 thinking 版本。2B、4B、8B 和 32B 模型为 dense 架构,而 30B 和 235B 为 MoE。Unsloth 支持 Qwen3-VL 微调与 RL,并且 Qwen3-VL (8B) 可使用我们的 notebook 免费训练。
祝你感恩节快乐(如果你庆祝这个节日的话),否则,祝你本周余下的日子愉快!=)
来源:Unsloth Blog · unslothai.substack.com