Liquid AI 发布端侧 MoE 模型 LFM2.5-8B-A1B
LFM2.5-8B-A1B: An Even Better On-Device Mixture of Experts
Liquid AI 发布端侧 MoE 模型 LFM2.5-8B-A1B,面向消费级硬件上的快速可靠工具调用,基础版与后训练版已在 Hugging Face 和 Playground 上线。
官方给出与前代逐项对比和端侧吞吐数据,可据此判断小参数 MoE 在本地工具调用上的可用边界。
今天,我们发布 LFM2.5-8B-A1B,这是一款专为在消费级硬件上实现快速、可靠工具调用而构建的边缘模型。
它基于我们 2025 年 10 月发布的 LFM2-8B-A1B,拥有扩展至 128K 的上下文窗口、规模更大的预训练(从 12T 增加到 38T token)以及大规模强化学习。我们还将词表扩大了一倍,以提高非拉丁语系的 tokenization 效率。最终得到的模型能够串联工具调用、完成任务,甚至能轻松运行在入门级笔记本电脑上。
基础模型(LFM2.5-8B-A1B-Base)和后训练模型(LFM2.5-8B-A1B)现已在 Hugging Face 和我们的 Playground 上提供。请查看我们的文档,了解如何在本地运行和微调它们。
自 LFM2-8B-A1B 以来的变化
与 LFM2-8B-A1B 相比,这个新版本将上下文窗口从 32,768 扩展到 128,000 token。这使模型能够处理更长的文档并进行更长时间的推理。其词表大小也从 65,536 扩展到 128,000,以更高效地对非拉丁文字进行 tokenization。我们看到在印地语、泰语、越南语、印尼语和阿拉伯语中获得了特别显著的压缩收益。架构的其余部分与 LFM2-8B-A1B 相同,采用 MoE、GQA 和门控短卷积模块的组合,如下图所示。
与其前身不同,LFM2.5-8B-A1B 是一个仅推理模型,在给出最终答案前会生成显式的思维链。我们采用这一策略是因为 MoE 模型通常在计算受限的环境中运行,此时较少的活跃参数使每个推理 token 的成本更低。这在保证速度的同时带来了显著的质量提升。
得益于推理和扩大规模的训练,这个新版本的表现显著更好:
基准测试 | LFM2-8B-A1B | LFM2.5-8B-A1B | Δ |
|---|---|---|---|
AA-Omniscience 指数 | -78.42 | -24.70 | +53.62 |
AA-Omniscience 准确率 | 7.33 | 8.67 | +1.34 |
AA-Omniscience 非幻觉率 | 7.46 | 63.47 | +56.01 |
IFEval | 79.44 | 91.84 | +12.40 |
IFBench | 26.00 | 56.47 | +30.47 |
Multi-IF | 58.54 | 79.93 | +21.39 |
MATH500 | 74.80 | 88.76 | +13.96 |
AIME25 | 20.00 | 42.53 | +22.53 |
BFCLv3 | 45.07 | 64.36 | +19.29 |
BFCLv4 | 25.52 | 48.50 | +22.98 |
Tau² Telecom | 13.60 | 88.07 | +74.47 |
Tau² Retail | 7.02 | 39.82 | +32.80 |
训练亮点
Tokenizer 扩展。LFM2-8B-A1B 最初使用针对我们初始语言覆盖范围优化的 65K BPE tokenizer 进行训练。为了更好地支持 LFM2.5 中的非拉丁文字,我们通过就地扩展现有 tokenizer 将词表扩大一倍至 128K,而不是从头重新训练模型。我们在多语言语料上从原始合并继续 BPE 合并训练,这使大多数现有 token ID 保持为恒等映射,并使每个新 token 都能确定性地分解为原始子 token 序列。我们将新嵌入行初始化为其子 token 分解的均值,并原样复制共享行。然后我们通过简短的两阶段适应来恢复质量:仅嵌入训练,随后进行全模型持续预训练。
下表报告了字符/token,即每个 token 大致承载多少文本:越高越好,而新 tokenizer 在所有 16 种语言中都更高效
Tokenizer | 阿拉伯语 (ar) | 德语 (de) | 英语 (en) | 西班牙语 (es) | 法语 (fr) | 印地语 (hi) | 印度尼西亚语 (id) | 意大利语 (it) | 日语 (ja) | 韩语 (ko) | 波兰语 (pl) | 葡萄牙语 (pt) | 俄语 (ru) | 泰语 (th) | 越南语 (vi) | 中文 (zh) |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
旧分词器 | 2.239 | 3.641 | 4.063 | 3.442 | 3.618 | 0.961 | 2.731 | 3.251 | 1.836 | 1.652 | 2.672 | 3.194 | 2.703 | 0.671 | 1.519 | 1.475 |
新分词器 | 3.107 | 3.783 | 4.137 | 3.579 | 3.759 | 2.118 | 3.513 | 3.475 | 1.963 | 1.943 | 2.895 | 3.450 | 2.876 | 2.269 | 3.311 | 1.620 |
提升 | +38.8% | +3.9% | +1.8% | +4.0% | +3.9% | +120.4% | +28.6% | +6.9% | +6.9% | +17.6% | +8.3% | +8.0% | +6.4% | +238.2% | +117.9% | +9.8% |
上下文扩展。我们首先通过一个专注于推理、数学、工具使用和更长文档的 2T token 中期训练阶段,将上下文窗口扩展到 32K。随后,我们通过增大 RoPE 基数 θ 并额外运行一个专注于长文档和长轨迹数据的 400B token 中期训练阶段,将上下文扩展到 128K。
死循环。我们增加了一个针对性的偏好优化阶段,以减少长推理轨迹中的死循环。该阶段会识别在特定上下文中容易触发循环行为的 token,然后将概率质量重新分配给合理的替代项,同时基本保持其余下一个 token 分布不变。在 RL 期间,我们还添加了一个轻量级的塑形奖励,以抑制过度使用常见的诱发循环的重启词,如“Wait…”。我们将在专门的博客文章中分享有关完整流程、目标和实证结果的更多细节。
幻觉。由于参数数量较少,边缘模型的知识容量有限,这会导致更多幻觉。为缓解幻觉,我们增加了一个针对性的 RL 阶段,在多样化的知识数据集上使用基于 avg@k 的奖励。目标是强化对超出可靠知识范围的查询的拒答,同时保留现有知识。这会产生更清晰的知识边界,以及对不确定性的更明确表达。
基准测试
我们在涵盖知识、指令遵循、数学和智能体工作流的基准测试中评估了 LFM2.5-8B-A1B。该模型与总参数量相近的稠密替代模型以及大得多的 MoE 相比都具有竞争力。
模型 | 参数 | AA-Omniscience | 指令遵循 | ||||
|---|---|---|---|---|---|---|---|
指数 | 准确率 | 非幻觉 | IFEval | IFBench | Multi-IF | ||
LFM2.5-8B-A1B | 8B/A1B | -24.70 | 8.67 | 63.47 | 91.84 | 56.47 | 79.93 |
Granite-4.0-H-Tiny | 7B/A1B | -75.50 | 9.37 | 6.38 | 82.23 | 21.28 | 59.00 |
Qwen3.5-4B | 4B | -51.53 | 17.20 | 16.99 | 87.80 | 50.38 | 67.43 |
Qwen3-30B-A3B-Thinking-2507 | 30.5B/3.3B | -51.31 | 18.80 | 13.87 | 90.82 | 51.11 | 79.04 |
Gemma-4-E2B-IT | 5.1B | -72 | 7.00 | 15.05 | 82.93 | 33.53 | 69.70 |
Gemma-4-E4B-IT | 8B | -50.67 | 8.10 | 36.06 | 87.74 | 39.48 | 77.58 |
Gemma-4-26B-A4B-IT | 26B/4B | -62.07 | 14.37 | 10.75 | 91.40 | 47.25 | 82.06 |
gpt-oss-20b | 21B/3.6B | -49.17 | 14.57 | 24.50 | 86.73 | 58.65 | 76.64 |
基于 avg@k 的奖励使 LFM2.5-8B-A1B 在保持合理准确率的同时实现了显著更低的幻觉率。它还在指令遵循基准测试中领先,以一小部分激活参数量匹配了像 Gemma 4-26B 这样更大的 MoE。
数学与智能体工作流
模型 | 参数 | 数学 | 工具使用 | |||||
|---|---|---|---|---|---|---|---|---|
MATH500 | AIME25 | AIME26 | BFCLv3 | BFCLv4 | Tau² Telecom | Tau² Retail | ||
LFM2.5-8B-A1B | 8B/A1B | 88.76 | 42.53 | 50.00 | 64.79 | 49.73 | 88.07 | 39.82 |
Granite-4.0-H-Tiny | 7B/A1B | 59.20 | 4.93 | 3.33 | 56.89 | 28.52 | 16.67 | 18.42 |
Qwen3.5-4B | 4B | 80.76 | 54.28 | 58.33 | 71.06 | 54.01 | 87.72 | 71.93 |
Qwen3-30B-A3B-Thinking-2507 | 30.5B/3.3B | 86.48 | 71.67 | 66.67 | 73.39 | 50.53 | 21.93 | 56.14 |
Gemma-4-E2B-IT | 5.1B | 64.00 | 26 | 30 | 56.44 | 31.91 | 22.37 | 18.95 |
Gemma-4-E4B-IT | 8B | 65.00 | 34.33 | 40.67 | 57.31 | 33.92 | 26.75 | 42.11 |
Gemma-4-26B-A4B-IT | 26B/4B | 94.20 | 68.67 | 72.00 | 68.87 | 55.87 | 42.11 | 55.26 |
gpt-oss-20b | 21B/3.6B | 92.40 | 68.53 | 68.67 | 62.52 | 49.88 | 57.24 | 53.51 |
在智能体基准测试中,LFM2.5-8B-A1B 与更大的模型相比具有竞争力,在 Tau2-Telecom 上表现尤为突出。随着智能体框架逐渐成为使用模型的主要方式,LFM2.5-8B-A1B 是迈向端侧、完全私密智能体的第一步。
稀疏推理,无处不在
LFM2.5-8B-A1B 发布首日即获得整个推理生态系统的支持:
- LEAP — Liquid 的边缘 AI 平台,用于 iOS 和 Android 部署
- llama.cpp — 用于高效边缘推理的 GGUF 检查点
- MLX — 针对 Apple Silicon 优化的推理
- vLLM — GPU 加速的服务,用于生产吞吐量
- SGLang — GPU 加速的服务,用于生产吞吐量
- ONNX — 跨多种加速器的跨平台推理
CPU 推理。 LFM2.5-8B-A1B 发布首日即支持 llama.cpp,可在日常消费级硬件上运行。
在两款笔记本级芯片上,它都是我们测试过的读取提示和生成答案最快的模型,在 M5 Max 上解码速度达 253 tokens/s,在 Ryzen AI Max+ 395 上达 146 tokens/s,同时内存占用保持在 6 GB 以下。它甚至在手机上也能保持约 30 tokens/s,因此一个强大的助手可以在你自己的设备上即时、私密地运行。
GPU 推理。 我们通过 vLLM 和 SGLang 支持推理,并积极为这些代码库做出贡献。我们在单块 NVIDIA H100 SXM5 GPU 上使用持续负载设置测量输出吞吐量(总输出 token 数除以实际耗时):在每个并发级别下,我们持续维持目标数量的在途请求,每完成一个请求就立即替换。
我们使用 SGLang 0.5.12、1,024 个输入 token、最多 256 个输出 token、BF16 精度对每个模型进行基准测试,每个并发级别平均运行 3 次。LFM2.5-8B-A1B 是其规模级别中最快的模型,在高并发下达到每秒 18.5K 输出 token,单块 H100 上每天超过 1.6B token。
本地协作:亲眼见证它运行
我们的开源桌面智能体演示 Localcowork 现在运行在 LFM2.5-8B-A1B 上。其配置与我们三月份用于 LFM2-24B-A2B 演示的相同:单台笔记本电脑、13 个 MCP 服务器上的 67 个工具、无云端、无 API 密钥、数据不离开本机。在相同的工具菜单下,工具选择更快,且明显更可靠。
这个演示的重点不在于单个工具。而在于工具调度循环在消费级硬件上感觉是交互式的:询问、提议、确认、运行、重复,每次调度都远低于一秒,拥有完整的审计追踪,且你的数据永远不会离开设备。
开始使用
借助 LFM2.5,我们正在实现 AI 随处运行的愿景。这些模型:
- 开放权重 — 下载、微调、部署均无限制
- 发布首日即快速 — 原生支持 llama.cpp、MLX、vLLM、SGLang,覆盖 Apple、AMD、Intel、Qualcomm 和 Nvidia 硬件
- 完整的家族 — 从用于定制的基座模型到专门的音频和视觉变体,一种架构覆盖多种用例
端侧智能体的未来从这里开始。我们迫不及待想看到你构建的作品。
在 Playground 上试用
在 Hugging Face 上下载
请使用以下参考文献或 BibTeX 引用本文:
Liquid AI,“LFM2.5-8B-A1B:你笔记本电脑上的个人助理”,Liquid AI 博客,2026 年 5 月。
来源:Liquid AI Blog · liquid.ai