跳到正文
Liquid AI Blog·· 2026-05-28精选AI 评分67

Liquid AI 发布端侧 MoE 模型 LFM2.5-8B-A1B

LFM2.5-8B-A1B: An Even Better On-Device Mixture of Experts

AI 导读

Liquid AI 发布端侧 MoE 模型 LFM2.5-8B-A1B,面向消费级硬件上的快速可靠工具调用,基础版与后训练版已在 Hugging Face 和 Playground 上线。

推荐理由

官方给出与前代逐项对比和端侧吞吐数据,可据此判断小参数 MoE 在本地工具调用上的可用边界。

正文 · AI 翻译

今天,我们发布 LFM2.5-8B-A1B,这是一款专为在消费级硬件上实现快速、可靠工具调用而构建的边缘模型。

它基于我们 2025 年 10 月发布的 LFM2-8B-A1B,拥有扩展至 128K 的上下文窗口、规模更大的预训练(从 12T 增加到 38T token)以及大规模强化学习。我们还将词表扩大了一倍,以提高非拉丁语系的 tokenization 效率。最终得到的模型能够串联工具调用、完成任务,甚至能轻松运行在入门级笔记本电脑上。

基础模型(LFM2.5-8B-A1B-Base)和后训练模型(LFM2.5-8B-A1B)现已在 Hugging Face 和我们的 Playground 上提供。请查看我们的文档,了解如何在本地运行和微调它们。

*AA-Omniscience 指数(越高越好)奖励正确答案并惩罚幻觉。分数范围从 -100 到 100。更多结果请见 Artificial Analysis。

自 LFM2-8B-A1B 以来的变化

与 LFM2-8B-A1B 相比,这个新版本将上下文窗口从 32,768 扩展到 128,000 token。这使模型能够处理更长的文档并进行更长时间的推理。其词表大小也从 65,536 扩展到 128,000,以更高效地对非拉丁文字进行 tokenization。我们看到在印地语、泰语、越南语、印尼语和阿拉伯语中获得了特别显著的压缩收益。架构的其余部分与 LFM2-8B-A1B 相同,采用 MoE、GQA 和门控短卷积模块的组合,如下图所示。

与其前身不同,LFM2.5-8B-A1B 是一个仅推理模型,在给出最终答案前会生成显式的思维链。我们采用这一策略是因为 MoE 模型通常在计算受限的环境中运行,此时较少的活跃参数使每个推理 token 的成本更低。这在保证速度的同时带来了显著的质量提升。

得益于推理和扩大规模的训练,这个新版本的表现显著更好:

基准测试

LFM2-8B-A1B

LFM2.5-8B-A1B

Δ

AA-Omniscience

指数

-78.42

-24.70

+53.62

AA-Omniscience

准确率

7.33

8.67

+1.34

AA-Omniscience

非幻觉率

7.46

63.47

+56.01

IFEval

79.44

91.84

+12.40

IFBench

26.00

56.47

+30.47

Multi-IF

58.54

79.93

+21.39

MATH500

74.80

88.76

+13.96

AIME25

20.00

42.53

+22.53

BFCLv3

45.07

64.36

+19.29

BFCLv4

25.52

48.50

+22.98

Tau² Telecom

13.60

88.07

+74.47

Tau² Retail

7.02

39.82

+32.80

训练亮点

Tokenizer 扩展。LFM2-8B-A1B 最初使用针对我们初始语言覆盖范围优化的 65K BPE tokenizer 进行训练。为了更好地支持 LFM2.5 中的非拉丁文字,我们通过就地扩展现有 tokenizer 将词表扩大一倍至 128K,而不是从头重新训练模型。我们在多语言语料上从原始合并继续 BPE 合并训练,这使大多数现有 token ID 保持为恒等映射,并使每个新 token 都能确定性地分解为原始子 token 序列。我们将新嵌入行初始化为其子 token 分解的均值,并原样复制共享行。然后我们通过简短的两阶段适应来恢复质量:仅嵌入训练,随后进行全模型持续预训练。

下表报告了字符/token,即每个 token 大致承载多少文本:越高越好,而新 tokenizer 在所有 16 种语言中都更高效

Tokenizer

阿拉伯语

(ar)

德语

(de)

英语

(en)

西班牙语

(es)

法语

(fr)

印地语

(hi)

印度尼西亚语

(id)

意大利语

(it)

日语

(ja)

韩语

(ko)

波兰语

(pl)

葡萄牙语

(pt)

俄语

(ru)

泰语

(th)

越南语

(vi)

中文

(zh)

旧分词器

2.239

3.641

4.063

3.442

3.618

0.961

2.731

3.251

1.836

1.652

2.672

3.194

2.703

0.671

1.519

1.475

新分词器

3.107

3.783

4.137

3.579

3.759

2.118

3.513

3.475

1.963

1.943

2.895

3.450

2.876

2.269

3.311

1.620

提升

+38.8%

+3.9%

+1.8%

+4.0%

+3.9%

+120.4%

+28.6%

+6.9%

+6.9%

+17.6%

+8.3%

+8.0%

+6.4%

+238.2%

+117.9%

+9.8%

上下文扩展。我们首先通过一个专注于推理、数学、工具使用和更长文档的 2T token 中期训练阶段,将上下文窗口扩展到 32K。随后,我们通过增大 RoPE 基数 θ 并额外运行一个专注于长文档和长轨迹数据的 400B token 中期训练阶段,将上下文扩展到 128K。

死循环。我们增加了一个针对性的偏好优化阶段,以减少长推理轨迹中的死循环。该阶段会识别在特定上下文中容易触发循环行为的 token,然后将概率质量重新分配给合理的替代项,同时基本保持其余下一个 token 分布不变。在 RL 期间,我们还添加了一个轻量级的塑形奖励,以抑制过度使用常见的诱发循环的重启词,如“Wait…”。我们将在专门的博客文章中分享有关完整流程、目标和实证结果的更多细节。

幻觉。由于参数数量较少,边缘模型的知识容量有限,这会导致更多幻觉。为缓解幻觉,我们增加了一个针对性的 RL 阶段,在多样化的知识数据集上使用基于 avg@k 的奖励。目标是强化对超出可靠知识范围的查询的拒答,同时保留现有知识。这会产生更清晰的知识边界,以及对不确定性的更明确表达。

基准测试

我们在涵盖知识、指令遵循、数学和智能体工作流的基准测试中评估了 LFM2.5-8B-A1B。该模型与总参数量相近的稠密替代模型以及大得多的 MoE 相比都具有竞争力。

模型

参数

AA-Omniscience

指令遵循

指数

准确率

非幻觉

IFEval

IFBench

Multi-IF

LFM2.5-8B-A1B

8B/A1B

-24.70

8.67

63.47

91.84

56.47

79.93

Granite-4.0-H-Tiny

7B/A1B

-75.50

9.37

6.38

82.23

21.28

59.00

Qwen3.5-4B

4B

-51.53

17.20

16.99

87.80

50.38

67.43

Qwen3-30B-A3B-Thinking-2507

30.5B/3.3B

-51.31

18.80

13.87

90.82

51.11

79.04

Gemma-4-E2B-IT

5.1B

-72

7.00

15.05

82.93

33.53

69.70

Gemma-4-E4B-IT

8B

-50.67

8.10

36.06

87.74

39.48

77.58

Gemma-4-26B-A4B-IT

26B/4B

-62.07

14.37

10.75

91.40

47.25

82.06

gpt-oss-20b

21B/3.6B

-49.17

14.57

24.50

86.73

58.65

76.64

基于 avg@k 的奖励使 LFM2.5-8B-A1B 在保持合理准确率的同时实现了显著更低的幻觉率。它还在指令遵循基准测试中领先,以一小部分激活参数量匹配了像 Gemma 4-26B 这样更大的 MoE。

数学与智能体工作流

模型

参数

数学

工具使用

MATH500

AIME25

AIME26

BFCLv3

BFCLv4

Tau² Telecom

Tau² Retail

LFM2.5-8B-A1B

8B/A1B

88.76

42.53

50.00

64.79

49.73

88.07

39.82

Granite-4.0-H-Tiny

7B/A1B

59.20

4.93

3.33

56.89

28.52

16.67

18.42

Qwen3.5-4B

4B

80.76

54.28

58.33

71.06

54.01

87.72

71.93

Qwen3-30B-A3B-Thinking-2507

30.5B/3.3B

86.48

71.67

66.67

73.39

50.53

21.93

56.14

Gemma-4-E2B-IT

5.1B

64.00

26

30

56.44

31.91

22.37

18.95

Gemma-4-E4B-IT

8B

65.00

34.33

40.67

57.31

33.92

26.75

42.11

Gemma-4-26B-A4B-IT

26B/4B

94.20

68.67

72.00

68.87

55.87

42.11

55.26

gpt-oss-20b

21B/3.6B

92.40

68.53

68.67

62.52

49.88

57.24

53.51

在智能体基准测试中,LFM2.5-8B-A1B 与更大的模型相比具有竞争力,在 Tau2-Telecom 上表现尤为突出。随着智能体框架逐渐成为使用模型的主要方式,LFM2.5-8B-A1B 是迈向端侧、完全私密智能体的第一步。

稀疏推理,无处不在

LFM2.5-8B-A1B 发布首日即获得整个推理生态系统的支持:

  • LEAP — Liquid 的边缘 AI 平台,用于 iOS 和 Android 部署
  • llama.cpp — 用于高效边缘推理的 GGUF 检查点
  • MLX — 针对 Apple Silicon 优化的推理
  • vLLM — GPU 加速的服务,用于生产吞吐量
  • SGLang — GPU 加速的服务,用于生产吞吐量
  • ONNX — 跨多种加速器的跨平台推理

CPU 推理。 LFM2.5-8B-A1B 发布首日即支持 llama.cpp,可在日常消费级硬件上运行。

在两款笔记本级芯片上,它都是我们测试过的读取提示和生成答案最快的模型,在 M5 Max 上解码速度达 253 tokens/s,在 Ryzen AI Max+ 395 上达 146 tokens/s,同时内存占用保持在 6 GB 以下。它甚至在手机上也能保持约 30 tokens/s,因此一个强大的助手可以在你自己的设备上即时、私密地运行。

GPU 推理。 我们通过 vLLM 和 SGLang 支持推理,并积极为这些代码库做出贡献。我们在单块 NVIDIA H100 SXM5 GPU 上使用持续负载设置测量输出吞吐量(总输出 token 数除以实际耗时):在每个并发级别下,我们持续维持目标数量的在途请求,每完成一个请求就立即替换。

我们使用 SGLang 0.5.12、1,024 个输入 token、最多 256 个输出 token、BF16 精度对每个模型进行基准测试,每个并发级别平均运行 3 次。LFM2.5-8B-A1B 是其规模级别中最快的模型,在高并发下达到每秒 18.5K 输出 token,单块 H100 上每天超过 1.6B token。

本地协作:亲眼见证它运行

我们的开源桌面智能体演示 Localcowork 现在运行在 LFM2.5-8B-A1B 上。其配置与我们三月份用于 LFM2-24B-A2B 演示的相同:单台笔记本电脑、13 个 MCP 服务器上的 67 个工具、无云端、无 API 密钥、数据不离开本机。在相同的工具菜单下,工具选择更快,且明显更可靠。

这个演示的重点不在于单个工具。而在于工具调度循环在消费级硬件上感觉是交互式的:询问、提议、确认、运行、重复,每次调度都远低于一秒,拥有完整的审计追踪,且你的数据永远不会离开设备。

开始使用

借助 LFM2.5,我们正在实现 AI 随处运行的愿景。这些模型:

  • 开放权重 — 下载、微调、部署均无限制
  • 发布首日即快速 — 原生支持 llama.cpp、MLX、vLLM、SGLang,覆盖 Apple、AMD、Intel、Qualcomm 和 Nvidia 硬件
  • 完整的家族 — 从用于定制的基座模型到专门的音频和视觉变体,一种架构覆盖多种用例

端侧智能体的未来从这里开始。我们迫不及待想看到你构建的作品。

Liquid AI logo在 Playground 上试用hugging face logo liquid AI在 Hugging Face 上下载

请使用以下参考文献或 BibTeX 引用本文:

Liquid AI,“LFM2.5-8B-A1B:你笔记本电脑上的个人助理”,Liquid AI 博客,2026 年 5 月。

来源:Liquid AI Blog · liquid.ai