Mistral 发布 Mistral Large 4 公开预览,1 万亿参数多模态模型
Mistral Large 4
Mistral 推出 Mistral Large 4 公开预览,这是一个 1 万亿参数、490 亿激活参数的 natively 多模态模型,可通过 Mistral Studio 的预览 API 试用,权重将于本月底发布。
同一新闻,精选展示《Mistral 发布 Mistral Large 4 公开预览,1 万亿参数原生多模态模型》
Le Chonk
今天,我们推出 Mistral Large 4 的公开预览版。非正式名称 ML4,非常正式地称为:le Chonk。ML4 将开放权重性能推向新前沿。你今天就可以在 Mistral Studio 上试用预览 API。权重将于本月底发布。
前沿性能
ML4 是一个 1 万亿参数的原生多模态模型,拥有 490 亿活跃参数。它是我们迄今为止规模最大、能力最强的模型,并且随着我们不断优化,它仍在快速提升。
该模型在编程、智能体工作流和多模态理解方面展现出卓越性能。它已经达到与全球最强开源模型相竞争的水平,同时显著超越美国和欧洲开发的任何开放权重模型。在网络安全、金融和法律等关键企业工作负载上,我们发现它在开放模型中处于最先进水平。在视觉定位等某些领域,它更进一步,甚至超越了前沿闭源模型。
我们将在本月底发布权重。在此之前,我们正与网络安全领导者、经过审核的合作伙伴和国家主管部门在真实环境中对该模型进行红队测试,他们将以降低的审核强度和扩展的网络能力访问同一模型。
锻造于欧洲。为 AI 主权而构建。
ML4 在 Mistral 位于欧洲的自有数据中心中,使用 3,800 块 NVIDIA Grace Blackwell GPU 从零开始训练。公开预览版也在同一基础设施上提供服务。这是我们在基础设施、研究和产品开发方面长期投资的一个重要里程碑:在关键垂直领域实现最先进的性能,通过开放权重交付,旨在让客户掌控自己的 AI。
这在网络安全领域尤为重要,因为提供商层面的拒绝可能会阻碍合法的漏洞研究和事件响应,而在事件处理过程中失去某项能力本身就可能成为重大安全风险。ML4 将顶尖的网络性能与开放权重和自部署相结合,使组织既拥有能力,也拥有自主权,能够按照自己的政策开展高级安全工作。
该模型将在全球多个地区提供,包括 Mistral 端到端运营的欧洲部署,独立于其他数字服务提供商,并受欧洲法律管辖。有趣的是:ML4 训练数据中有很大一部分是多语言的,涵盖 160 多种语言,包括欧盟的所有官方语言。
我们一直与全球金融、工程、制造、物流、制药、科学、航运、公共部门及其他关键任务行业的领先企业密切合作来训练 ML4。事实上,该模型使用了我们通过 Mistral Forge 向客户提供的相同训练、定制和 RL 环境。
立即试用
还有更多内容即将推出。在我们努力发布权重的同时,我们将分享有关模型架构、更多基准测试以及我们后训练方法的更多细节。
该模型还将作为新一代专门化和优化 Mistral 模型的基础。与此同时,我们邀请你试用预览 API,并在社交媒体上与我们分享你的反馈。
能力深入解析
网络安全
ML4 是全球最强的网络安全 AI 模型之一。在 Artificial Analysis Cyber Index 这一独立评估中——该评估衡量 AI 模型在真实软件中发现并修复安全漏洞的能力——它位列全球前五,并大幅领先于中国以外开发的开源权重模型。在该指数的一项测试中,要求模型复现开源软件中的真实漏洞并加以修补,ML4 得分 82%,是所有模型中最高的。它还能解决 Cybench 中 93% 的挑战,Cybench 是一组取自安全竞赛的 40 道练习,这是开源权重模型报告的最高分之一。
这一最高分反映了一项实际优势。包括 Claude Opus 5.5 和 GPT-6 Astra 在内的若干领先闭源模型在同一测试中得分接近零,因为它们拒绝执行该任务。然而,防御软件往往始于证明漏洞真实存在,而这正是闭源模型中的安全过滤器可能阻止的工作。随着威胁行为者越来越多地越狱这些同样的模型以支持攻击性网络活动,这一点变得更加重要:防御者需要能够匹敌这些能力、又不受同样拒绝机制约束的系统。ML4 可以完成这项工作,而且其能力超出了它被明确训练的范围:在内部测试中,它被证明可用于分析恶意软件、对漏洞进行优先级排序以及编写检测规则。对于需要主权、可审计的 AI 用于安全运营的组织,它将能够在私有云或本地部署中运行。
ML4 对比同类模型:高效推理应对多样复杂挑战
恶意软件逆向工程:解决一项分布外调查任务
智能体编程
ML4 在软件工程、代码仓库理解和复杂终端工作流方面表现出色,在 DeepSWE v1.1 上得分 61.7%,在 SWE-Atlas-QnA 上得分 59.4%,在 Terminal-Bench 4 上得分 28.3%。其 Coding Agent Index 综合得分 49.8%,领先于 DeepSeek V4 Pro 0813 和 Qwen3.8 Max。
我们还与 Surge AI 就编程质量进行了一次盲测人工评估:专业标注员在隐藏模型身份的情况下,按 1–5 分对模型输出进行评分。ML4 Preview 在五个模型中排名第二(3.74),领先于 Kimi K3(3.59)、GLM-5.3(3.60)和 GLM-5.2(3.40),仅次于 Claude Opus 5(4.22)。
%25201_20jgWu.webp%3Fdpl%3D6ac516f190c69e0008d46233&mode=full&exp=1791590400&sig=be0eb31bfe9b9496)
智能体工作流
ML4 可运行通用智能体,在复杂工作流中收集信息、使用工具并产出最终交付物。在 AutomationBench 上——涵盖 Gmail、Google Sheets、Slack 和 Salesforce 等应用中的 657 个业务工作流——它得分 59.9%,领先于 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro。
在知识工作实际产出的专业交付物——电子表格、幻灯片和 PDF——方面,它同样出色。在评估长周期知识工作的 AA-Briefcase 上,它达到 1,393 Elo,领先于 DeepSeek V4 Pro。

多模态
ML4 标志着我们的模型在理解图像能力上的跨越式提升。它能对复杂文档、图表和自然图像进行强大推理,并将视觉能力带入感知至关重要的行业,如工程、制造和地球观测。
该模型可以进一步将视觉定位与智能体能力相结合:从检查千兆像素卫星图像——帮助灾害响应团队在时间紧迫时采取行动——到分析工程图纸——放大、检查并验证,直到答案精确无误。在上面的演示中,ML4 能够对密集的自然场景进行定位,验证技术图纸中的机械部件,从 PDF 中检索证据,并在海量地理空间图像中扫描最难找到的目标。
特别是在视觉定位方面,我们发现 ML4 是我们测试过的最有能力的模型之一,例如在 Dense 200 上超过了 GPT-6-Astra(42% 对 41%)。
科学与数学
ML4 具备强大的科学能力,这是通过将 AI 驱动的方法与我们研究人员在数学、物理和化学方面的专业知识相结合而构建的。
它非常擅长面向科学任务的智能体编码,例如数据分析、建模和物理现实模拟,这让研究人员能够专注于问题本身,而不是繁琐的底层工作。在基准测试中,ML4 在开放权重模型中于 SciCode-Verified 上达到最先进水平。在实践中,它可以一次性生成完整的 Hartree–Fock 模拟——这是一项由一系列高级例程构成的复杂多步骤化学任务。
ML4 的数学能力也更强,无论是在形式推理还是应用数学方面。在我们的人工评估中,它比 GLM-5.3 推理更精确、更有条理,并且能够持续完成长时间、特定领域的应用数学任务,包括与前沿理论物理相关的工作。
这些能力共同使 ML4 成为贯穿整个技术工作流程的强大研究助手——从最初的问题到最终的结果。
-alt_ZYLgs8.webp%3Fdpl%3D6ac516f190c69e0008d46233&mode=full&exp=1791590400&sig=16271a9918a7466e)
SciCode-Verified 测试模型在物理、数学、材料科学和生物学等领域用代码实现复杂科学工作流程的能力。

ML4 与 GLM5.3 在 STEM 任务(数学和物理)上的内部评估
知识工作
ML4 是我们最有能力的模型,适用于专业人士每天处理的真实世界任务。它可以创建、编辑和修复复杂的电子表格和文档,在法律和金融基准测试中均表现出色。
值得注意的是,我们通过第三方评估机构(vals.ai)在法律和金融代表性任务上对 ML4 进行了评估,发现该模型在这两种情况下都超过了 GPT-6-Astra。在 HarveyAI 的法律智能体基准测试中,ML4 的表现优于所有开源模型。
FinWorkBench 测试模型在真实金融和会计用例中创建/编辑电子表格的能力。
金融分析要求精确性以及从多个来源综合信息的能力,这一过程如今在许多金融机构中仍然耗时。在这个演示中,ML4 与其他顶级开源模型一起应对同一个多步骤公司金融挑战,搜索上市公司文件与财务报告,例如通过 EDGAR 和同等欧洲数据库提供的那些。一张动态语义图追踪每个模型通向解决方案的路径,突出显示沿途检索到的每一份文档。每条轨迹的位置反映了已收集的证据、计算结果以及仍未解决的问题。观众可以跟随调查的展开过程,并比较每个模型在得出最终答案之前所走的不同路径。
模型安全
ML4 在间接提示注入的鲁棒性上已使我们的基准测试饱和,使其处于 OSS 模型的前沿(与 GLM-5.2、GLM-5.3、Kimi-K2.6、Kimi-K3、DS-V4-Pro-0813 相比)。在 Lakera 公开的 B3 AI Security Benchmark 上,ML4 抵御了 93.3% 的攻击——我们在竞争对手中未见到更高的分数。
ML4 与用户的互动也比我们以往任何模型都更负责任。我们重点展示在 KORA Benchmark 上的结果,ML4 再次位居我们测得的 OSS 模型最高分(1.691,最高为 2,标记为“Exemplary”)。
尤为相关的是该模型拒绝有关网络安全的恶意请求的倾向。尽管在 Cyber 基准测试上表现强劲,但该模型对来自 JailbreakBench、StrongREJECT 和 AgentHarm 的网络提示的平均拒绝率高于所有 OSS 模型。
人工评估
我们进行了一项内部评估,由编码、计算机辅助设计(CAD)、金融、数学和物理领域的专家标注员将 Mistral Large 4 与 GLM-5.3 进行比较。ML4 在 CAD 和 STEM 领域更受青睐,而在金融和编码领域表现与 GLM-5.3 持平或接近。

大规模强化学习
基础模型正在快速进步,我们的后训练必须跟上步伐。为昨天的模型调优的配方会在今天的模型上留下未挖掘的能力,因为曾经将模型推向极限的真实样本如今已不再如此。我们使用强化学习(RL),因为它能随模型一起适应:我们基于模型自身尝试的结果进行训练,并且随着模型变强,我们可以提高任务的难度和广度。
我们的 RL 库旨在让新环境易于添加并大规模训练。一个共享、可组合的接口允许单次训练运行组合从单轮聊天、复杂科学问题求解到安全对齐、事实性和长时程工具使用等各类任务。这些环境共享脚手架和资源,如代码沙箱、网络搜索和外部 API。同样的可组合性也延伸到验证环节,奖励模型、单元测试、LLM 评判器和静态检查可根据每个任务的需要进行组合。
在运行时,一个自动扩缩容的 actor 集群并行生成数万条 rollout,同时模型训练异步进行。生成和训练流水线针对长轨迹进行了优化,支持跨多次压缩的数百万 token 的 rollout 预算,同时保持较低的陈旧度。两个阶段的新方法和优化最大限度地减少了离策略漂移,并实现了长时程下的稳定 RL。
在我们当前的规模(3k GPU)下,单次训练运行每天大约产生 330 亿 token,其中经过过滤和掩码后约有 160 亿是可训练的补全 token。我们可以直接从训练 rollout 中看到运行进展:随着策略学会解决越来越复杂的任务,训练奖励在多个代表性环境中上升。以下是一些示例。

这些改进并非我们训练环境所特有;它们会迁移到下游评估中,最终模型将其归功于两个后训练阶段(监督微调与 RL),如下图所示。

下一步
这仅仅是个开始。ML4 是我们由 30 亿欧元 D 轮融资所支持路线图上的第一个里程碑——这是欧洲科技公司有史以来规模最大的一轮股权融资。这笔资金已经在投入使用:我们正在大幅扩展自有欧洲数据中心内的算力容量,未来几个月还会有更多算力上线。
更多算力意味着更多训练。此次预览背后的强化学习运行仍在进行中,模型尚未显示出饱和迹象——前方仍有充足的提升空间。随着我们在扩展后的基础设施上扩大训练规模,我们预计未来数周乃至数月将出现大幅且快速的改进。
我们将在本月底发布权重,同时公布更多关于架构、额外基准测试以及我们后训练方法的细节。而 ML4 仅仅是基础:它将作为新一代专业化、优化版 Mistral 模型的基座,这些模型专为我们的客户最关心的行业和工作负载而打造。
从此刻起,进展的步伐将会很快。敬请关注。
来源:Mistral AI · mistral.ai