跳到正文
Liquid AI Blog·· 2026-08-12精选AI 评分65

Liquid AI 发布端侧视觉语言模型 LFM2.5-VL-3B

LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge

AI 导读

Liquid AI 发布 LFM2.5-VL-3B,一款面向端侧的非推理型视觉语言模型,已在 Hugging Face 和官方 Playground 上线。

推荐理由

官方给出 28 项基准与端侧、GPU 实测数据,可对照同尺寸竞品判断 3B 级视觉模型的实际能力边界。

正文 · AI 翻译

今天,我们发布 LFM2.5-VL-3B,这是我们目前最强大的视觉语言模型。它在视觉性能上可与两倍于其规模的模型竞争,同时在各种 CPU 和 GPU 部署中运行更快,甚至比参数更少的模型还要快。

LFM2.5-VL-3B 基于我们之前的 LFM2-VL-3B 构建,在屏幕理解、定位、函数调用和多图像输入方面有显著改进。LFM2.5-VL-3B 是一个非推理模型,直接作答,为实时和端侧应用保持低延迟。

该模型今天已在 Hugging Face 和 我们的 Playground 上线。请查看我们的 文档,了解如何在本地运行和微调它。

新特性

LFM2.5-VL-3B 在我们之前版本的基础上扩展了视觉语言能力,带来四项重大改进:

屏幕/UI 理解。LFM2.5-VL-3B 对移动端、网页和桌面端的数字屏幕有很强的理解能力。它在 ScreenSpot-v2 上平均得分 80.7,远超规模大得多的 Gemma-4-E4B(51.2)和 Qwen 3.5 4B(78.5),并接近更大的 InternVL-3.5-4B(84.1) 

函数调用。作为我们 VL 系列的新增能力,LFM2.5-VL-3B 在工具使用和函数调用方面显著更强,无论是纯文本还是视觉-文本输入。ToolSandbox 从 26.4 提升一倍多至 59.5,BFCL v4 从 20.5 攀升至 32.5,使其与 Gemma-4-E2B 持平,并领先于 Qwen3.5-2B。

定位。LFM2.5-VL-3B 通过扩展合成定位数据显著提升了定位性能。它将 RefCOCO precision@1 从 57.1 提升至 87.9,相比我们之前的版本提升了 30 个点。

多图像输入。改进了跨多图像的推理能力,将 BLINK 从 50.2 提升至 61.5,MUIRBench 从 34.9 提升至 58.3。

训练

LFM2.5-VL-3B 沿用我们之前 VLM 的架构,即 LFM2.5-VL-1.6B 和 LFM2.5-VL-450M。它基于与我们刚发布的 LFM2.5-2.6B 文本模型相同的预训练基础构建,并集成了 SigLIP2 400M NaFlex 编码器。

与之前的 LFM2-VL-3B 版本相比,它在约 34T token 上进行了预训练。为了更好地支持 LFM2.5 中的非拉丁文字,我们通过就地扩展现有分词器将词表翻倍至 128K。 

此外,我们将视觉预训练的 token 量扩大了 4 倍,同时通过大量精选和合成的图像-标题、OCR、定位和指令遵循数据混合,提升了数据质量。

后训练流程包括监督微调(SFT),其中包含来自更大教师模型的知识蒸馏和 Antidoom 训练,随后是多奖励强化学习(RL)。

视觉基准

我们在 28 个基准上评估了 LFM2.5-VL-3B,涵盖多语言视觉理解、指令遵循、视觉数学与科学推理、文档理解、目标检测、多图像理解和屏幕理解。

LFM2.5-VL-3B 在理解物理世界和数字世界方面尤为出色。它在 RealWorldQA、POPE 和 RefCOCO 等真实世界图像任务上领先同尺寸级别,同时在数字内容方面也表现良好,涵盖文档、图表以及屏幕上的 UI 元素。在这些基准测试的平均成绩上,LFM2.5-VL-3B 显著优于规模大得多的 Gemma 模型,并与更大的 4.7B Qwen 3.5 模型相差仅 0.7%。1

任务

基准测试

LFM2.5-VL-3B (3.1B)

LFM2-VL-3B (3.1B)

gemma-4-E2B-it (5.1B)

gemma-4-E4B-it (8B)

InternVL 3.5 2B (2.4B)

InternVL 3.5 4B (4.7B)

Qwen3.5-2B (2.3B)

Qwen3.5-4B (4.7B)

通用

MMStar

63.3

57.7

45.3

52.9

57.7

65.5

55.1

59.3

MME

73.1

73.0

54.9

67.6

73.6

81.0

76.2

79.5

RealWorldQA

73.1

71.1

60.0

64.3

61.6

67.7

65.1

67.1

SimpleVQA

35.4

33.0

27.3

30.4

30.5

33.7

35.2

40.7

SEED-Bench (image)

77.7

76.6

71.4

75.3

75.4

76.4

75.8

76.1

MMBench (dev EN v1.1)

81.0

80.0

64.2

71.6

76.2

81.1

73.1

78.4

CountBenchQA

87.3

92.2

70.4

80.5

70.4

82.5

83.8

86.7

多语言

MMMB

83.0

81.9

73.3

80.4

76.3

81.5

75.9

82.0

Multilingual MMBench

79.5

76.3

62.8

71.2

70.9

76.6

69.9

77.0

多模态指令遵循

MM-IFEval

60.6

51.4

65.6

68.2

47.1

54.5

55.4

63.1

STEM

LogicVista

37.4

32.2

29.5

34.5

30.9

36.2

34.0

37.6

MathVista (mini)

68.5

62.1

37.8

45.2

56.8

67.1

48.7

63.6

MMMU-Pro

30.5

28.7

26.9

32.6

21.3

22.7

24.9

36.0

MMMU (val)

48.4

45.6

41.1

49.3

52.0

60.7

44.1

50.3

文档、OCR 与图表

ChartQA (test)

81.3

80.4

43.2

42.1

81.7

86.2

78.4

84.2

DocVQA (val)

91.1

89.8

85.7

87.4

88.4

91.8

92.6

94.8

InfographicVQA (val)

70.2

67.8

54.4

60.9

69.3

76.9

73.5

80.3

OCRBench v1

84.2

81.7

70.2

73.5

83.9

82.0

84.4

85.6

OCRBench v2 (En)

47.5

43.9

44.4

48.8

45.5

49.1

47.7

58.7

TextVQA (val)

84.3

83.0

62.5

69.0

76.6

77.5

77.3

81.2

定位

RefCOCO-avg

87.9

57.1

67.3

72.1

82.9

88.8

78.5

86.6

多图像

BLINK

61.5

50.2

45.2

52.2

52.0

57.2

48.6

58.7

MuirBench

58.3

34.9

32.9

51.8

45.0

53.5

48.2

62.0

幻觉

HallusionBench

47.2

46.4

41.8

49.8

47.6

52.1

49.3

51.7

POPE

88.7

89.2

84.0

86.9

88.0

88.9

88.6

86.0

GUI

ScreenSpot-v2 Desktop

78.7

6.0

28.1

45.8

79.9

82.0

63.8

76.3 

ScreenSpot-v2 Mobile

81.2

7.6

42.9

60.3

86.2

87.8

69.7 

81.4 

ScreenSpot-v2 Web

82.2

2.5

22.4

47.6

79.9

82.6

65.9 

77.8 

平均

-

69.4

57.2

52.0

59.7

64.6

69.4

63.7

70.1

文本基准测试

我们还在纯文本基准测试上,针对指令遵循和工具使用,将 LFM2.5-VL-3B 与同一组模型进行了评估。指令遵循全面提升,工具使用大幅改善,ToolSandbox 从 26.4 翻倍以上至 59.5。在工具使用方面,LFM2.5-VL-3B 与 Gemma-4-E2B 和 Qwen3.5-2B 相当。2

任务

基准测试

LFM2.5-VL-3B (3.1B)

LFM2-VL-3B (3.1B)

gemma-4-E2B-it (5.1B)

gemma-4-E4B-it (8B)

InternVL 3.5 2B (2.4B)

InternVL 3.5 4B (4.7B)

Qwen3.5-2B (2.3B)

Qwen3.5-4B (4.7B)

指令遵循

IFEval

82.3

72.9

83.0

87.9

32.4

35.4

73.6 

86.2 

IFBench

25.8

20.8

34.1

39.2

24.4

24.5

28.9

33.5 

Multi-IF

59.4

46.5

69.4

77.4

16.3

16.9

53.5 

66.7 

工具使用与函数调用

ToolSandbox

59.5

26.4

56.5

61.6

N/A

N/A

47.7

65.0 

BFCL V4

32.5

20.5

33.2

40.0

N/A

N/A

33.9 

53.6

这些结果使 LFM2.5-VL-3B 成为一个强大且全面的视觉语言模型。它在图像描述、视觉问答和文档理解等日常任务中表现良好,尤其在采取行动、边界框检测以及读取数字屏幕和文档方面尤为出色。 

随处快速推理

LFM2.5-VL-3B 在发布首日即获得整个推理生态系统的支持:

  • llama.cpp — 用于高效边缘推理的 GGUF 检查点
  • MLX — 针对 Apple Silicon 优化的推理
  • vLLM — 面向生产吞吐量的 GPU 加速服务
  • SGLang — 面向生产吞吐量的 GPU 加速服务
  • ONNX — 跨平台推理,适配多种加速器

端侧推理。LFM2.5-VL-3B 在 Apple M5 Max 上解码速度达 228 tokens/s,在 AMD Ryzen AI Max+ 395 上达 116 tokens/s,同时内存占用保持在约 3 GB。其紧凑的视觉编码器也使其首 token 延迟很低,而 InternVL 等编码器更重的模型在同一张图片上则会卡顿。它甚至能在手机上运行,在 Galaxy S26 Ultra 上解码速度达 20 tokens/s,因此一个能力出色的视觉模型可以在你自己的设备上私密运行。

GPU 推理。LFM2.5-VL-3B 专为在 GPU 上实现快速、响应灵敏的推理而打造。由于它直接作答而非进行推理,因此即使在图像密集的输入上也能快速返回首个 token。我们在单块 NVIDIA H100 SXM5 GPU 上,一次一个请求,测量三种输入类型的首 token 延迟:单张 512x512 图像、一张 512x512 图像加 1,024 token 的输入文本,以及 5 个 256x256 的 5 帧视频片段。LFM2.5-VL-3B 始终保持低延迟,并在多帧输入上大幅领先,在 5 帧视频片段上约 34 ms 即返回首个 token,而 Gemma 模型则需要约 200 ms。

我们还在单块 NVIDIA H100 SXM5 GPU 上使用持续负载设置测量输出吞吐量(总输出 token 数 / 实际耗时):在每个并发级别下,我们持续维持目标数量的在途请求,每完成一个请求就立即补充。

我们使用 vLLM 0.26 对每个模型进行基准测试,采用 512×512 图像加 1,024 输入 token、最多 256 输出 token,BF16 精度,并报告每个并发级别 5 次运行的中位数。LFM2.5-VL-3B 在我们测试的所有模型中达到最高输出吞吐量,在高并发下约为每秒 11K token。这大约是更大的 4B 级模型的 2 倍,甚至领先于更小的 2B 级模型,相当于在单块 H100 上每天近 1B 输出 token。

观看 LFM2.5-VL-3B 实际运行

你可以通过我们的 WebGPU 演示 直接在浏览器中试用 LFM2.5-VL-3B。该模型完全在设备端运行,无需任何设置。你可以上传图片或从摄像头捕获一张静态图像,观看模型的实际运行效果。

文档理解。给定一个文档页面,模型一次性分析整个页面,识别区域并分配布局标签。

屏幕/UI 理解。给定查找特定文档页面的高层目标,模型会浏览网站以满足该目标。模型对每个屏幕进行视觉分析以确定点击位置,并重复此过程直到到达目标页面。

函数调用。给定一张菜品图片和获取其食谱的请求,模型识别出该菜品,并确定应调用搜索工具来查找食谱。

定位。给定一个自然语言请求,模型在图像中定位指定对象,并为每个对象返回一个边界框。

开始使用

立即使用 LFM2.5-VL-3B 开始构建,已在 Hugging Face 上提供。

借助 LFM2.5,我们正在实现让 AI 随处运行的愿景。这些模型:

  • 开放权重 — 可无限制地下载、微调和部署
  • 从第一天起就快速 — 原生支持 llama.cpp、MLX 和 vLLM,覆盖 Apple、AMD、Qualcomm 和 Nvidia 硬件
  • 完整的模型家族 — 从用于定制的基础模型到专门的音频和视觉变体,一种架构覆盖多种用例

我们迫不及待想看到你构建的作品。

hugging face logo liquid AI在 Hugging Face 上下载Liquid AI logo阅读我们的文档Liquid AI logo在 Playground 上试用

引用

请按以下格式引用本文:

Liquid AI, "LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge", Liquid AI Blog, Aug 2026.

1 评估使用 vLLM 0.26.0 以及各模型推荐的生成参数(如有)进行。所有地方均使用非推理模式,并提示模型直接作答而不进行推理。

表中的所有数值均归一化到 0–100。原始基准测试中,MME 使用 0-2800,OCRBench 使用 0-1000,DocVQA 和 InfographicVQA 使用 0–1。

RefCOCO-avg 是以下 8 个划分上 P@1 的平均值:RefCOCO: val, testA, testB,RefCOCO+: val, testA, testB,RefCOCOg: val, test

POPE 是 adversarial、popular 和 random 子集中所有样本的 F1

MMMU-Pro 使用 10 选项的多选题变体

2 InternVL 3.5 模型不支持函数调用。

来源:Liquid AI Blog · liquid.ai