跳到正文
Meta AI Research Blog·· 2026-08-10精选AI 评分72

Meta 发布开源端侧智能体模型 Muse Glimmer

Introducing Muse Glimmer: An Open Agentic Model That Runs on Your Device

AI 导读

Meta Superintelligence Labs 发布 30B 参数模型 Muse Glimmer,以 Apache 2.0 许可开源权重,面向常驻本地的智能体工作流,可在配备单张消费级 GPU 的 Mac 或 PC 上运行。

推荐理由

Meta 开源 30B 端侧智能体模型,量化后可在单张消费级 GPU 上运行,为本地 Agent 部署提供了新的权重选择。

正文 · AI 翻译

今天,我们推出 Muse Glimmer,这是来自 Meta Superintelligence Labs 的下一代模型,并以宽松的 Apache 2.0 许可证开源模型权重。

Muse Glimmer 是一个 300 亿参数的模型,专为常驻本地智能体工作流优化。它足够小,可以在配备单块消费级 GPU 的 Mac 或 PC 上运行,支持从本地智能体和函数调用,到本地编码,再到 LLM-as-a-judge 评估等多种用例。与同尺寸类别中的领先模型相比,Muse Glimmer 在关键智能体用例和基准测试中表现出色。

基础模型在推理、代码生成和工具使用方面已取得显著能力——但大多数部署仍依赖云基础设施和网络访问。在本地运行模型让你随时随地使用 AI,无论是否有互联网连接。这正变得越来越可行:开源社区已经证明,较小的模型如果训练得当,可以在特定任务上接近前沿水平。Muse Glimmer 正是为这些本地用例优化的。

秉承我们分享基础 AI 研究的悠久传统,我们今天在 Hugging Face 上发布 Muse Glimmer 开放权重,同时提供开发者文档,帮助你开始构建和运行自己的智能体。Muse Glimmer 旨在与开发者已经使用的工具配合工作。llama.cpp、MLX 和 ExecuTorch 上的优化集成将在未来几天内落地,让你在几分钟内从下载到拥有可用的智能体。

我们如何训练 Muse Glimmer

一个能管理你的日程、起草你的消息、整理你的文件并学习你工作方式的智能体,需要深度访问个人上下文。它还需要多项能力协同工作:长时程执行、精确工具调用、多模态理解、长上下文记忆和指令遵循。

我们设计 Muse Glimmer 时,在能力与本地硬件的内存和计算限制之间取得平衡。这需要紧凑的架构、一种新颖的蒸馏配方(从大得多的教师模型迁移智能体推理能力),以及包括量化在内的推理优化,以满足延迟预期。我们通过以下阶段实现了这一点:

  • 预训练。我们使用 logit 蒸馏在 Muse Spark 的输出上训练 Muse Glimmer,并利用了与教师模型相似的数据混合。
  • 中期训练。我们在更长上下文、更偏智能体、包含更丰富推理轨迹的数据以及有机数据上训练模型。
  • 后训练。我们将监督微调与在通用、推理、编码和智能体领域的策略内蒸馏和强化学习相结合。

Muse Glimmer 按照 Meta 的 Advanced AI Scaling Framework 中规定的标准进行了评估,并针对所有相关类别进行了开放权重发布评估。

为智能体而建:Muse Glimmer 能做什么

构建有效的智能体需要关键能力协同工作以实现用户目标。Muse Glimmer 针对以下每一项进行了训练和评估:

  • 端到端智能体任务完成。 Muse Glimmer 在 DeepSearch QA、MCP-Atlas、𝛕-Bench 和 SWE-Bench 等全任务基准测试中取得了较高的成功率,这些测试衡量了其在脚手架内工作、编写和调试代码,以及从头到尾解决多轮请求的能力。
  • 可靠的工具使用。 该模型能够处理广泛的函数调用,在扩展的工作流中始终以精确的 schema 调用工具。
  • 多步推理。 Muse Glimmer 在长跨度上进行链式推理,在复杂、扩展的工作流中保持连贯的计划。
  • 故障恢复。 当工具调用失败或返回意外结果时,该模型经过训练能够诊断错误并重试,而不是停止。
  • 多模态输入与推理。 通过专用的感知编码器,该模型接受交错的文本和图像。这使智能体能够结合对话解读截图、图表和文档。
  • 脚手架兼容性。 Muse Glimmer 可跨 OpenClaw 及其他智能体编排模式工作。
  • 可控投入。 Muse Glimmer 支持不同的推理强度,以在质量与速度之间选择恰当的平衡。
  • 多语言。 Muse Glimmer 在来自 100 多种语言的数据上进行训练。

Muse Glimmer 在 OpenCode 中完成端到端的 Home Assistant 仪表板任务。播放位置0:00 / 0:00

性能

我们在广泛的基准测试中评估了 Muse Glimmer,以衡量有效自主智能体行为所需的多样化能力。与 Gemma4-31B 和 Qwen3.6-27B 相比,Muse Glimmer 在其规模级别上于多个广泛使用的 LLM 基准测试中表现强劲。

Table comparing Muse Glimmer 30B with Gemma4 31B and Qwen3.6 27B across agentic, coding, multimodal, safety, and reasoning benchmarks.

有关我们评估的更多细节,请参阅我们的报告。

针对本地部署优化

本地智能体只有快到足以让人感觉响应及时,才真正有用。一个需要数分钟才能回复或规划下一步的智能体会打断实际工作的流程。我们应用了两项优化,使 Muse Glimmer 在不牺牲质量的前提下,以实用速度在消费级硬件上运行。

让模型适配你的设备。

在全精度下,一个 300 亿参数的模型将需要超过 55 GB 的内存——远超任何消费级 GPU 所能提供。我们使用量化技术将模型权重压缩至约 4 位精度,将语言模型缩小至 20 GB 以下。这为模型的工作内存(其“KV 缓存”)、用于图像理解的感知编码器以及推测解码草稿模型在 24 GB 或 32 GB 的范围内同时运行留出了足够的余量。我们验证了这种压缩在智能体任务上带来的性能下降极小甚至没有。

Table comparing full precision, K-Quant-Dynamic, and K-Quant-17GB by accuracy degradation and target hardware memory.

通过推测解码实现更快的生成。

语言模型通常一次生成一个 token 的文本,在长推理链或多步工具调用期间可能会显得缓慢。Muse Glimmer 搭载了一个基于 DFlash 的轻量级“drafter”模型——这是一个小型配套网络,可一次性提出整块 token。随后主模型会并行验证这些提议,接受正确的 token 并纠正错误的 token。这项技术让 Muse Glimmer 的文本生成速度显著快于标准的逐 token 生成,同时产出完全相同的输出质量。我们在发布中提供了量化版 drafter,以降低内存开销。

Muse Glimmer 使用与不使用 DFlash 推测解码的并排对比。播放位置0:00 / 0:00

结果:

我们在 MacBook M4-Max、M5-Max 以及 RTX-5090 上测量了 K-Quant-17GB 模型与量化版 DFlash drafter 的速度。该模型快到足以支持流畅对话和实时智能体交互,且完全在你的设备上运行。

Bar chart showing DFlash speculative decoding increasing Muse Glimmer decode speed by 3.1 times on RTX 5090, 1.8 times on M5 Max, and 1.5 times on M4 Max.

立即开始使用 Muse Glimmer

Muse Glimmer 现已可用,你可以在 Hugging Face 上下载权重。未来几天内,你可以通过 Ollama、LM Studio 和 Unsloth 等合作伙伴在本地运行它,使用 llama.cpp、ExecuTorch 和 MLX 等边缘框架进行部署,通过 vLLM 和 SGLang 大规模提供服务,或通过 Together AI、Fireworks AI 和 OpenRouter 等合作伙伴快速上手。你甚至可以利用 PyTorch 的 TorchTitan 训练功能进一步微调模型,为你的用例进行定制。

我们还在与 AMD、Arm、Dell、Intel 和 NVIDIA 等合作伙伴合作,以优化跨设备的性能。此外,我们发布了文档,让开发者拥有开始使用 Muse Glimmer 并负责任地进行构建所需的资源。其中包括关于设置自定义 scaffold 的指导,让你从第一天起就能更轻松地开始构建和部署个人智能体。你可以在 Meta 的 AI 开发者中心了解更多信息并找到构建资源。

这项工作建立在 Meta 长期开放 AI 研究记录的基础之上,将其扩展到智能体 AI,并让开发者能够使用本地智能体能力。一如既往,我们欢迎社区的反馈,并迫不及待想看到开发者用这个开放权重模型构建出什么。

在 Hugging Face 上下载模型 开发者文档

来源:Meta AI Research Blog · research.meta.ai