跳到正文
Meta AI Research Blog·· 2026-07-09精选AI 评分68

Meta 发布 Muse Spark 1.1 多模态推理模型并开放 Meta Model API 预览

Introducing Muse Spark 1.1

AI 导读

Meta Superintelligence Labs 发布 Muse Spark 1.1,这是 Muse Spark 的升级版多模态推理模型,面向智能体任务,在工具与电脑操作、编码和多模态理解上有明显提升。

推荐理由

Meta 官方给出 Muse Spark 1.1 在智能体、编码与多模态上的能力变化,并首次开放 Meta Model API 公共预览。

正文 · AI 翻译

今天,我们很高兴推出 Muse Spark 1.1,这是 Meta Superintelligence Labs 的最新模型,也是 Muse Spark 的一次重大升级。Muse Spark 1.1 是一款为智能体任务打造的多模态推理模型,在工具与计算机使用、编程以及多模态理解方面均有大幅提升。

凭借这些改进,Muse Spark 1.1 推进了性能与效率的前沿。结合本周发布的 Muse Image,此次发布让我们离个人超级智能的愿景更近一步:帮助模型助你追求目标、创造想象之物、加深人际关系,并为你最珍视的事情采取行动。

伴随此次发布,我们还推出了全新 Meta Model API 的公开预览版,开发者可通过它访问 Muse Spark 1.1。该模型现已在 Meta AI 应用和 meta.ai 上以“Thinking”模式提供。

评估

Table comparing Muse Spark 1.1 with Muse Spark, Gemini 3.1 Pro, Opus 4.8, and GPT 5.5 across agent, coding, and multimodal benchmarks.

有关我们评估的更多详情,请参阅我们的报告。

智能体

Muse Spark 1.1 在需要跨一系列外部应用和服务进行规划与编排的个人智能体任务中表现出色。它能零样本泛化到新的原生工具、MCP 服务器和自定义技能。

Bar chart showing Muse Spark 1.1 scoring 54.7 on JobBench, ahead of Opus 4.8 at 48.4 and GPT 5.5 at 38.3.

Bar chart showing Muse Spark 1.1 scoring 88.1 on MCP Atlas, ahead of the other compared models.

Bar chart comparing Muse Spark 1.1 with four other models on DeepSearchQA.

它处理复杂项目的速度显著快于 Muse Spark,因为它经过训练可以编排多智能体系统,以优化端到端延迟。作为主智能体,它可以收集上下文、制定计划,并将执行任务委派给并行的子智能体。作为子智能体,它恪守自身职责,了解可用工具,并知道何时向主智能体上报。

Muse Spark 1.1 可以主动管理其 100 万 token 的上下文窗口。它能记住操作、从更早的工作中检索信息,并以保留后续工作所需关键步骤的方式进行压缩。

Line chart showing higher WideSearch scores for multi-agent Muse Spark 1.1 than for single-agent Muse Spark 1.1 across latency proxy budgets.

计算机使用

Chart comparing OSWorld 2.0 score and task cost for Muse Spark 1.1, Gemini 3.1 Pro, GPT 5.5, and Opus 4.8.

Muse Spark 1.1 擅长在多个应用之间展开、信息实时变化的计算机使用工作流。它能在长时间会话中保持上下文,适应不断变化的需求,并以最少的人工干预驾驭不熟悉的界面。

Muse Spark 1.1 不会对每个桌面步骤逐次点击进行推理,而是懂得何时自动化、何时直接使用界面。我们训练该模型在自动化更快时编写脚本,在直接交互更简单时进行点击,并在每一步生成批量操作。

Messenger 界面显示 Muse Spark 1.1 在收到新宾客信息后更新晚宴订单。播放位置0:00 / 0:00

智能体式晚宴组织:在真实应用中,会出现改变任务的新上下文。Muse Spark 1.1 在下晚宴订单时能注意到这些变化,并在无需用户干预的情况下进行必要更新。

编程

Muse Spark 1.1 的编程性能在涉及大型复杂代码库的真实任务上大幅提升。它可以诊断并修复复杂缺陷、在企业级系统中实现新功能,并执行大规模代码迁移。在创建 Web 应用和端到端问答等用例中,Muse Spark 1.1 相较我们的首个模型展现出大幅提升。

Two bar charts showing Muse Spark 1.1 improving over Muse Spark on Vibe Code Bench v1.1 and SWE Atlas Codebase QnA.

我们训练模型以平滑适应各种不同的运行框架,并可靠地处理复杂的多轮动态。Muse Spark 1.1 在流行的智能体编程环境中表现出色,支持规划模式、目标条件设定、子智能体委派和上下文压缩等常见功能。

OpenCode 和一个 Web 应用并排显示,Muse Spark 1.1 正在调查并修复一个问题。播放位置0:00 / 0:00

OpenCode 中的调试演示:Muse Spark 1.1 构建一个聊天 Web 应用,自动截取屏幕截图以 识别用户可见的故障,将问题追溯到相关代码以实施修复,并 验证这些更改。该模型无缝结合了编程、多模态理解和工具 调用。

在 Meta 内部,开发人员和研究人员每天都在使用 Muse Spark 1.1 来更快地构建、更智能地工作。在我们的主要内部编程评估 Meta Internal Coding Bench 上,Muse Spark 1.1 相比 Muse Spark 有显著提升,并与领先的替代方案具有竞争力。

Bar chart comparing five models on Meta Internal Coding Bench, with Muse Spark 1.1 scoring 68.3.

研究人员现在还在工作流程中利用 Muse Spark 1.1 来自动化模型开发和评估任务。

OpenCode 显示评估 DeepSWE 任务的八步计划。播放位置0:00 / 0:00

OpenCode 中的 DeepSWE 评估:Muse Spark 1.1 在不同推理强度下对 DeepSWE 任务的子集进行自我评估,并根据结果生成分析仪表板。

多模态

Chart comparing BabyVision score and task cost for Muse Spark 1.1, Gemini 3.1 Pro, GPT 5.5, and Opus 4.8.

除了编程和智能体能力外,Muse Spark 1.1 在感知、多模态推理和工具使用方面也表现出色。它能够与真实环境交互并生成有依据的输出,在视觉到代码产物生成、超详细图像和视频描述以及多模态用例的智能体工作流执行方面具有优势。

当感知和行动需要同时发生时,Muse Spark 1.1 的多模态能力尤其有价值。该模型可以检查视觉和音频,在长工作流中保留细节,并在代表用户操作计算机时使用这些细节。

Facebook Marketplace 商品发布编辑器,显示待售商品的照片和生成的描述。播放位置0:00 / 0:00

Facebook Marketplace 智能体:使用智能手机拍摄的视频,Muse Spark 1.1 提取有用的 照片并对产品进行推理,以操作用户的浏览器并代表用户发布 Facebook Marketplace 商品。

安全

我们在部署前进行了广泛的安全评估,遵循 Advanced AI Scaling Framework,该框架为我们最先进的模型定义了评估、威胁模型和部署阈值。

在所有前沿风险类别——化学与生物、网络安全和失控——中,我们的评估显示 Muse Spark 1.1 在安全范围内运行。Muse Spark 1.1 对直接越狱以及来自不可信数据的间接攻击、提示注入和开发者提示攻击表现出强大的抵抗力。因此,它展现出更好的对抗鲁棒性、更低的幻觉率和更少的谄媚。

我们关于 1.1 的完整安全态势记录在 Muse Spark 1.1 Evaluation Report 中。

可用性

开发者首次可以通过全新的 Meta Model API(现已开放公开预览)开始基于 Muse Spark 1.1 进行构建。Muse Spark 1.1 的早期合作伙伴称赞该模型是一个完整的智能体基础,将长上下文处理与强大的编码和推理能力相结合,以应对大规模智能体工作负载。

“Muse Spark 最令人印象深刻之处在于它将如此多的能力集于一身:百万级 token 的海量上下文、完整的多模态支持(图像、视频、PDF)、内置带引用的搜索、强大的推理能力、顶级的编码能力(尤其是前端和设计)、结构化输出以及并行工具调用——全部打包在一个干净的 OpenAI 兼容包中。一个完整的智能体基础。”

—— Amjad Masad,Replit 首席执行官

“Meta 显然正在为严肃的智能体编码而构建——强大的工具使用能力,且价格点使其能够大规模运行真实的编码工作负载。这种组合十分罕见,这正是我们希望 Cline 开发者能够尽早使用它的原因。”

—— Saoud Rizwan,Cline 首席执行官

“在针对 Box 企业工作评估集进行测试时,Muse Spark 交付了与当今领先前沿模型相媲美的企业级能力。这种智能水平,结合其在专业服务、公共部门和工业运营等行业中结构化、流程化工作流方面的优势,使其成为组织的理想选择。”

—— Yashodha Bhavnani,Box AI 产品副总裁

“Muse Spark 1.1 是运行智能体的绝佳模型。快速、强大,搭配 OpenClaw 使用非常有趣。”

—— Dave Morin,OpenClaw 基金会

我们非常激动地发布 Muse Spark 1.1,这证明了我们的研究势头。我们还有更强大的模型正在训练中,期待分享未来的成果。

来源:Meta AI Research Blog · research.meta.ai