Unsloth 新增 AMD GPU 训练支持并重做 Studio
Unsloth x AMD
Unsloth 与 AMD 合作,支持在 AMD Radeon、Instinct、Ryzen 及数据中心 GPU 上本地训练和运行 500 多个 LLM,覆盖 Windows、WSL 和 Linux,官方称仅需 3GB VRAM 即可训练,速度提升 2 倍、显存占用减少 70% 且无精度损失,并提供针对 GGUF 和 Safetensors 推理优化的 ROCm 构建。
Unsloth 新增 AMD GPU 本地训练支持并重做 Studio,读者可据此判断本地微调的硬件选择面。
大家好!距离上一期通讯已经有一段时间了,我们有很多更新。我们新增了 AMD 训练支持,并彻底重新构想了 Unsloth Studio,推出了全新的 Hub、扩展的自定义功能、更多语言支持,以及许多新功能、模型等等。
💚 Unsloth x AMD
我们与 AMD 合作,让你能够在 AMD GPU 上本地训练和运行 LLM,覆盖 500+ 模型。适用于 AMD Radeon、Instinct、Ryzen 和数据中心 GPU,跨 Windows、WSL 和 Linux。你可以在仅 3GB VRAM 上以 2 倍速度训练模型,VRAM 减少 70%,且无精度损失。我们还为 GGUF 和 Safetensors 推理提供了优化的 ROCm 构建。GitHub 仓库
🧭 全新模型 Hub
我们推出了全新的模型 Hub,让发现、下载和运行模型变得更加容易,具备热门动态、搜索、README 预览和可断点续传的下载管理器。我们还重建了模型上下文自动适配,在多种场景下实现了最高约 3 倍更长的上下文。
⚡ 动态 NVFP4 量化 + 更好的导出
我们发布了新的动态 NVFP4 量化,适用于 NVIDIA Blackwell GPU,覆盖 Qwen3.6 和 Gemma 4。它们能实现更快、更准确的 4 位推理。Unsloth 现在还可以在训练后创建合并的 FP8 和 NVFP4 导出,以及 imatrix 辅助的 GGUF 量化。
💎 Gemma 4 改进
完整的 Gemma 4 QAT 系列现在可以在 Unsloth 中运行和训练,包括新的 12B 模型以及 E2B、E4B、26B-A4B 和 31B。我们还上传了新的动态 NVFP4 量化。最近,Google 还添加了更好的工具调用和 MTP,以实现更快、更出色的本地推理。
🎨 让 Unsloth 成为你的专属
Unsloth Studio 的外观现在完全可自定义,调色板、自定义强调色/背景色、字体和无障碍设置,全部跨设备同步。我们现在还支持 12 种语言,包括日语、中文、葡萄牙语、印地语、阿拉伯语等。本地转录也将在本周推出!
🐳 更好的模型和 GPU 控制
我们现在对模型加载有了更多的自定义选项。加载现在会暴露 Flash Attention 和张量并行选项。新的 GPU 内存面板让你可以选择使用哪些 GPU、设置 GPU 层数并控制 MoE 专家卸载,或者将一切交给 Unsloth 的自动适配模式。
🔮 新模型
DeepSeek-V4-Flash、GLM-5.2、Qwen3.6 - 运行新的智能体模型
Inkling、DiffusionGemma、 Qwen-AgentWorld、Ornith、Kimi K2.7 Code 和 MiniMax-M3 - 现在均已在 Unsloth 中可用并受支持。
祝你七月剩下的日子愉快!我们还有更多硬件、Unsloth 和模型更新即将到来。🦥
来源:Unsloth Blog · unslothai.substack.com