Unsloth 2026 首次更新:MoE 训练提速 12 倍,新增嵌入模型与超长上下文 RL 支持
Unsloth 2026 Update - Faster MoE
Unsloth 发布 2026 年首个版本,MoE 训练提速 12 倍、显存占用降低超 35%、上下文延长 6 倍,gpt-oss-20b 可在 12.8GB 显存上运行,Qwen3-30B-A3B 的 16-bit LoRA 占用 63GB。
Unsloth 公布 MoE 训练、嵌入模型与长上下文 RL 三项提速数据,可据此判断本地微调的显存与成本变化。
欢迎来到我们 2026 年的首个版本。作为开篇,我们带来了 12 倍速的 MoE 训练、嵌入模型支持,以及用于强化学习的超长上下文。我们很快还会推出全新的 UI!
我们新增了对许多新模型的支持,你现在可以在本地运行并微调它们,包括 Qwen3-Coder-Next、DeepSeek-OCR 2、GLM-4.7-Flash、Kimi-2.5 等。
⭐ 我们还要感谢大家在 GitHub 上给予的 50K stars:https://github.com/unslothai/unsloth
💎 MoE 训练提速 12 倍
借助我们全新的 Triton 和数学内核,你现在可以以 12 倍的速度训练 MoE 模型,同时显存占用减少 >35%、上下文长度提升 6 倍(且无精度损失)。gpt-oss-20b 可在 12.8GB 显存下运行。Qwen3-30B-A3B(16 位 LoRA)占用 63GB。
Unsloth 支持对 gpt-oss、Qwen3(30B、235B、VL、Coder)、DeepSeek R1/V3 架构以及 GLM(4.7、Flash)模型进行快速训练。模型越大、使用的上下文越多,我们的 Unsloth 内核带来的显存节省就越明显。
🔎 嵌入模型训练现已提速 2 倍
微调嵌入模型可以大幅提升特定任务上的检索和 RAG 性能。我们与 Hugging Face 合作,实现了嵌入模型训练提速 1.8-3.3 倍,BERT 和分类器模型训练显存占用减少 20%、上下文长度提升 2 倍,且相比 FA2 方案无精度损失。
💡 超长上下文 RL 来了
强化学习(RL)最大的挑战在于支持长推理轨迹。我们全新的批处理算法可实现约 7 倍更长的上下文(甚至可超过 12 倍) RL,且相比使用 FA3、内核和分块损失的其他优化方案,无精度或速度下降。Unsloth 可在单块 192GB NVIDIA B200 GPU 上以 380K 上下文训练 gpt-oss QLoRA
🔮 新模型
🌠 Qwen3-Coder-Next:运行新发布的编程模型。
🐳 DeepSeek-OCR 2 - 运行并微调新的 OCR 模型。
⚡ GLM-4.7-Flash - 运行并微调同类最佳的 30B LLM。
📖 新指南
</> 如何将 Claude Code + Codex 与本地 LLM 配合使用:指南
👾 训练并部署到 LM Studio 进行本地推理:指南
🎨 使用 Unsloth GGUFs 运行 Diffusion 图像模型:指南
二月将成为 LLM 发布的精彩月份,我们希望你和我们一样兴奋。😊
来源:Unsloth Blog · unslothai.substack.com