跳到正文
Unsloth Blog· Unsloth AI·· 2025-10-03精选AI 评分59

Unsloth 发布多项强化学习新能力,支持 gpt-oss 与视觉模型

Unsloth new Reinforcement Learning

AI 导读

Unsloth 推出多项强化学习新能力,包括支持 OpenAI 的 gpt-oss、视觉模型以及更省显存的 RL,并称其 gpt-oss RL 推理速度超过其他实现。

推荐理由

Unsloth 集中放出多项强化学习能力更新,并给出量化模型在 Aider Polyglot 上的第三方基准数据,可据此判断其训练与量化工具链的当前水平。

正文 · AI 翻译

随着强化学习(RL)持续升温,Unsloth 的使命是让每个人都能更轻松、更便捷地使用它。我们推出了许多新的 RL 功能,包括对 OpenAI 的 gpt-oss、视觉模型的支持,以及更节省内存的 RL。此外,我们新的 gpt-oss RL 推理实现了比任何实现都更快的 tokens/s。

除了 RL,Unsloth 还专注于准确性和量化。第三方 Aider Polyglot 对 Unsloth DeepSeek-V3.1 Dynamic GGUFs 的基准测试显示,3-bit GGUF 在 Aider 上达到了 75.6%,仅比全精度未量化模型低 0.5%。这一 75.6% 的分数超越了 Claude-4-Opus(thinking)和 GPT-4.1 等 SOTA 模型。

Aider 是最全面的基准测试之一,用于测试 LLM 在无需人工干预的情况下编写、编码、遵循指令和应用更改的能力。

DeepSeek GGUF 结果

为了让训练更轻松,Unsloth 现在有了 Docker 镜像:只需在 Windows 或 Linux 上运行容器,即可开始训练,无需担心依赖问题。指南

以下是 Unsloth 的其他新闻:

🦥 Unsloth 更新

  • 推理在 RL 训练中至关重要。为了在不使用 vLLM 的情况下实现 gpt-oss 的最快推理速度,我们重写了 Transformers,使 gpt-oss 的推理速度至少提升 3 倍。你可以在我们的 Colab notebook 中使用 GRPO/GSPO 训练 gpt-oss,其中我们展示了如何自动创建更快的 GPU 内核。

gpt-oss RL 博客

  • 视觉 RL 现已支持 Gemma 3、Qwen2.5-VL 和其他视觉模型。得益于 Unsloth 独特的权重共享和自定义内核,Unsloth 使 VLM RL 速度提升 1.5–2 倍,VRAM 使用减少 90%,并支持比 FA2 设置长 10 倍的上下文长度,且无精度损失。

视觉 RL 博客

  • IBM 今天发布 Granite-4.0,Unsloth 已提供 Day Zero 支持。你可以使用我们的 Dynamic GGUFs 或包含支持代理示例的微调 notebook 来运行。指南

  • RL 现在更快且更节省内存!我们新的内核和算法使 RL 更快,VRAM 减少 50%,上下文长度增加 10 倍。博客

  • 为 gpt-oss 推出 Unsloth Flex Attention,支持超过 8 倍的上下文长度、超过 50% 的 VRAM 减少和超过 1.5 倍的速度提升。博客

  • 我们将于 10 月 21 日在旧金山 Y Combinator 办公室与 Mistral AI 和 NVIDIA 共同举办开发者活动。来打个招呼吧!

未来几周我们会有许多新的合作和功能,包括一款新产品发布,敬请期待!

r/unsloth Reddit

来源:Unsloth Blog · unslothai.substack.com