Liquid AI 发布端侧视觉语言模型 LFM2.5-VL-3B
LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge
Liquid AI 发布 LFM2.5-VL-3B,一款面向端侧的非推理型视觉语言模型,已在 Hugging Face 和官方 Playground 上线。
官方给出 28 项基准与端侧、GPU 实测数据,可对照同尺寸竞品判断 3B 级视觉模型的实际能力边界。
今天,我们发布 LFM2.5-VL-3B,这是我们目前最强大的视觉语言模型。它在视觉性能上可与两倍于其规模的模型竞争,同时在各种 CPU 和 GPU 部署中运行更快,甚至比参数更少的模型还要快。
LFM2.5-VL-3B 基于我们之前的 LFM2-VL-3B 构建,在屏幕理解、定位、函数调用和多图像输入方面有显著改进。LFM2.5-VL-3B 是一个非推理模型,直接作答,为实时和端侧应用保持低延迟。
该模型今天已在 Hugging Face 和 我们的 Playground 上线。请查看我们的 文档,了解如何在本地运行和微调它。
新特性
LFM2.5-VL-3B 在我们之前版本的基础上扩展了视觉语言能力,带来四项重大改进:
屏幕/UI 理解。LFM2.5-VL-3B 对移动端、网页和桌面端的数字屏幕有很强的理解能力。它在 ScreenSpot-v2 上平均得分 80.7,远超规模大得多的 Gemma-4-E4B(51.2)和 Qwen 3.5 4B(78.5),并接近更大的 InternVL-3.5-4B(84.1)
函数调用。作为我们 VL 系列的新增能力,LFM2.5-VL-3B 在工具使用和函数调用方面显著更强,无论是纯文本还是视觉-文本输入。ToolSandbox 从 26.4 提升一倍多至 59.5,BFCL v4 从 20.5 攀升至 32.5,使其与 Gemma-4-E2B 持平,并领先于 Qwen3.5-2B。
定位。LFM2.5-VL-3B 通过扩展合成定位数据显著提升了定位性能。它将 RefCOCO precision@1 从 57.1 提升至 87.9,相比我们之前的版本提升了 30 个点。
多图像输入。改进了跨多图像的推理能力,将 BLINK 从 50.2 提升至 61.5,MUIRBench 从 34.9 提升至 58.3。
训练
LFM2.5-VL-3B 沿用我们之前 VLM 的架构,即 LFM2.5-VL-1.6B 和 LFM2.5-VL-450M。它基于与我们刚发布的 LFM2.5-2.6B 文本模型相同的预训练基础构建,并集成了 SigLIP2 400M NaFlex 编码器。
与之前的 LFM2-VL-3B 版本相比,它在约 34T token 上进行了预训练。为了更好地支持 LFM2.5 中的非拉丁文字,我们通过就地扩展现有分词器将词表翻倍至 128K。
此外,我们将视觉预训练的 token 量扩大了 4 倍,同时通过大量精选和合成的图像-标题、OCR、定位和指令遵循数据混合,提升了数据质量。
后训练流程包括监督微调(SFT),其中包含来自更大教师模型的知识蒸馏和 Antidoom 训练,随后是多奖励强化学习(RL)。
视觉基准
我们在 28 个基准上评估了 LFM2.5-VL-3B,涵盖多语言视觉理解、指令遵循、视觉数学与科学推理、文档理解、目标检测、多图像理解和屏幕理解。
LFM2.5-VL-3B 在理解物理世界和数字世界方面尤为出色。它在 RealWorldQA、POPE 和 RefCOCO 等真实世界图像任务上领先同尺寸级别,同时在数字内容方面也表现良好,涵盖文档、图表以及屏幕上的 UI 元素。在这些基准测试的平均成绩上,LFM2.5-VL-3B 显著优于规模大得多的 Gemma 模型,并与更大的 4.7B Qwen 3.5 模型相差仅 0.7%。1
任务 | 基准测试 | LFM2.5-VL-3B (3.1B) | LFM2-VL-3B (3.1B) | gemma-4-E2B-it (5.1B) | gemma-4-E4B-it (8B) | InternVL 3.5 2B (2.4B) | InternVL 3.5 4B (4.7B) | Qwen3.5-2B (2.3B) | Qwen3.5-4B (4.7B) |
通用 | MMStar | 63.3 | 57.7 | 45.3 | 52.9 | 57.7 | 65.5 | 55.1 | 59.3 |
MME | 73.1 | 73.0 | 54.9 | 67.6 | 73.6 | 81.0 | 76.2 | 79.5 | |
RealWorldQA | 73.1 | 71.1 | 60.0 | 64.3 | 61.6 | 67.7 | 65.1 | 67.1 | |
SimpleVQA | 35.4 | 33.0 | 27.3 | 30.4 | 30.5 | 33.7 | 35.2 | 40.7 | |
SEED-Bench (image) | 77.7 | 76.6 | 71.4 | 75.3 | 75.4 | 76.4 | 75.8 | 76.1 | |
MMBench (dev EN v1.1) | 81.0 | 80.0 | 64.2 | 71.6 | 76.2 | 81.1 | 73.1 | 78.4 | |
CountBenchQA | 87.3 | 92.2 | 70.4 | 80.5 | 70.4 | 82.5 | 83.8 | 86.7 | |
多语言 | MMMB | 83.0 | 81.9 | 73.3 | 80.4 | 76.3 | 81.5 | 75.9 | 82.0 |
Multilingual MMBench | 79.5 | 76.3 | 62.8 | 71.2 | 70.9 | 76.6 | 69.9 | 77.0 | |
多模态指令遵循 | MM-IFEval | 60.6 | 51.4 | 65.6 | 68.2 | 47.1 | 54.5 | 55.4 | 63.1 |
STEM | LogicVista | 37.4 | 32.2 | 29.5 | 34.5 | 30.9 | 36.2 | 34.0 | 37.6 |
MathVista (mini) | 68.5 | 62.1 | 37.8 | 45.2 | 56.8 | 67.1 | 48.7 | 63.6 | |
MMMU-Pro | 30.5 | 28.7 | 26.9 | 32.6 | 21.3 | 22.7 | 24.9 | 36.0 | |
MMMU (val) | 48.4 | 45.6 | 41.1 | 49.3 | 52.0 | 60.7 | 44.1 | 50.3 | |
文档、OCR 与图表 | ChartQA (test) | 81.3 | 80.4 | 43.2 | 42.1 | 81.7 | 86.2 | 78.4 | 84.2 |
DocVQA (val) | 91.1 | 89.8 | 85.7 | 87.4 | 88.4 | 91.8 | 92.6 | 94.8 | |
InfographicVQA (val) | 70.2 | 67.8 | 54.4 | 60.9 | 69.3 | 76.9 | 73.5 | 80.3 | |
OCRBench v1 | 84.2 | 81.7 | 70.2 | 73.5 | 83.9 | 82.0 | 84.4 | 85.6 | |
OCRBench v2 (En) | 47.5 | 43.9 | 44.4 | 48.8 | 45.5 | 49.1 | 47.7 | 58.7 | |
TextVQA (val) | 84.3 | 83.0 | 62.5 | 69.0 | 76.6 | 77.5 | 77.3 | 81.2 | |
定位 | RefCOCO-avg | 87.9 | 57.1 | 67.3 | 72.1 | 82.9 | 88.8 | 78.5 | 86.6 |
多图像 | BLINK | 61.5 | 50.2 | 45.2 | 52.2 | 52.0 | 57.2 | 48.6 | 58.7 |
MuirBench | 58.3 | 34.9 | 32.9 | 51.8 | 45.0 | 53.5 | 48.2 | 62.0 | |
幻觉 | HallusionBench | 47.2 | 46.4 | 41.8 | 49.8 | 47.6 | 52.1 | 49.3 | 51.7 |
POPE | 88.7 | 89.2 | 84.0 | 86.9 | 88.0 | 88.9 | 88.6 | 86.0 | |
GUI | ScreenSpot-v2 Desktop | 78.7 | 6.0 | 28.1 | 45.8 | 79.9 | 82.0 | 63.8 | 76.3 |
ScreenSpot-v2 Mobile | 81.2 | 7.6 | 42.9 | 60.3 | 86.2 | 87.8 | 69.7 | 81.4 | |
ScreenSpot-v2 Web | 82.2 | 2.5 | 22.4 | 47.6 | 79.9 | 82.6 | 65.9 | 77.8 | |
平均 | - | 69.4 | 57.2 | 52.0 | 59.7 | 64.6 | 69.4 | 63.7 | 70.1 |
文本基准测试
我们还在纯文本基准测试上,针对指令遵循和工具使用,将 LFM2.5-VL-3B 与同一组模型进行了评估。指令遵循全面提升,工具使用大幅改善,ToolSandbox 从 26.4 翻倍以上至 59.5。在工具使用方面,LFM2.5-VL-3B 与 Gemma-4-E2B 和 Qwen3.5-2B 相当。2
任务 | 基准测试 | LFM2.5-VL-3B (3.1B) | LFM2-VL-3B (3.1B) | gemma-4-E2B-it (5.1B) | gemma-4-E4B-it (8B) | InternVL 3.5 2B (2.4B) | InternVL 3.5 4B (4.7B) | Qwen3.5-2B (2.3B) | Qwen3.5-4B (4.7B) |
指令遵循 | IFEval | 82.3 | 72.9 | 83.0 | 87.9 | 32.4 | 35.4 | 73.6 | 86.2 |
IFBench | 25.8 | 20.8 | 34.1 | 39.2 | 24.4 | 24.5 | 28.9 | 33.5 | |
Multi-IF | 59.4 | 46.5 | 69.4 | 77.4 | 16.3 | 16.9 | 53.5 | 66.7 | |
工具使用与函数调用 | ToolSandbox | 59.5 | 26.4 | 56.5 | 61.6 | N/A | N/A | 47.7 | 65.0 |
BFCL V4 | 32.5 | 20.5 | 33.2 | 40.0 | N/A | N/A | 33.9 | 53.6 |
这些结果使 LFM2.5-VL-3B 成为一个强大且全面的视觉语言模型。它在图像描述、视觉问答和文档理解等日常任务中表现良好,尤其在采取行动、边界框检测以及读取数字屏幕和文档方面尤为出色。
随处快速推理
LFM2.5-VL-3B 在发布首日即获得整个推理生态系统的支持:
- llama.cpp — 用于高效边缘推理的 GGUF 检查点
- MLX — 针对 Apple Silicon 优化的推理
- vLLM — 面向生产吞吐量的 GPU 加速服务
- SGLang — 面向生产吞吐量的 GPU 加速服务
- ONNX — 跨平台推理,适配多种加速器
端侧推理。LFM2.5-VL-3B 在 Apple M5 Max 上解码速度达 228 tokens/s,在 AMD Ryzen AI Max+ 395 上达 116 tokens/s,同时内存占用保持在约 3 GB。其紧凑的视觉编码器也使其首 token 延迟很低,而 InternVL 等编码器更重的模型在同一张图片上则会卡顿。它甚至能在手机上运行,在 Galaxy S26 Ultra 上解码速度达 20 tokens/s,因此一个能力出色的视觉模型可以在你自己的设备上私密运行。
GPU 推理。LFM2.5-VL-3B 专为在 GPU 上实现快速、响应灵敏的推理而打造。由于它直接作答而非进行推理,因此即使在图像密集的输入上也能快速返回首个 token。我们在单块 NVIDIA H100 SXM5 GPU 上,一次一个请求,测量三种输入类型的首 token 延迟:单张 512x512 图像、一张 512x512 图像加 1,024 token 的输入文本,以及 5 个 256x256 的 5 帧视频片段。LFM2.5-VL-3B 始终保持低延迟,并在多帧输入上大幅领先,在 5 帧视频片段上约 34 ms 即返回首个 token,而 Gemma 模型则需要约 200 ms。
我们还在单块 NVIDIA H100 SXM5 GPU 上使用持续负载设置测量输出吞吐量(总输出 token 数 / 实际耗时):在每个并发级别下,我们持续维持目标数量的在途请求,每完成一个请求就立即补充。
我们使用 vLLM 0.26 对每个模型进行基准测试,采用 512×512 图像加 1,024 输入 token、最多 256 输出 token,BF16 精度,并报告每个并发级别 5 次运行的中位数。LFM2.5-VL-3B 在我们测试的所有模型中达到最高输出吞吐量,在高并发下约为每秒 11K token。这大约是更大的 4B 级模型的 2 倍,甚至领先于更小的 2B 级模型,相当于在单块 H100 上每天近 1B 输出 token。
观看 LFM2.5-VL-3B 实际运行
你可以通过我们的 WebGPU 演示 直接在浏览器中试用 LFM2.5-VL-3B。该模型完全在设备端运行,无需任何设置。你可以上传图片或从摄像头捕获一张静态图像,观看模型的实际运行效果。
文档理解。给定一个文档页面,模型一次性分析整个页面,识别区域并分配布局标签。
屏幕/UI 理解。给定查找特定文档页面的高层目标,模型会浏览网站以满足该目标。模型对每个屏幕进行视觉分析以确定点击位置,并重复此过程直到到达目标页面。
函数调用。给定一张菜品图片和获取其食谱的请求,模型识别出该菜品,并确定应调用搜索工具来查找食谱。
定位。给定一个自然语言请求,模型在图像中定位指定对象,并为每个对象返回一个边界框。
开始使用
立即使用 LFM2.5-VL-3B 开始构建,已在 Hugging Face 上提供。
借助 LFM2.5,我们正在实现让 AI 随处运行的愿景。这些模型:
- 开放权重 — 可无限制地下载、微调和部署
- 从第一天起就快速 — 原生支持 llama.cpp、MLX 和 vLLM,覆盖 Apple、AMD、Qualcomm 和 Nvidia 硬件
- 完整的模型家族 — 从用于定制的基础模型到专门的音频和视觉变体,一种架构覆盖多种用例
我们迫不及待想看到你构建的作品。
在 Hugging Face 上下载
阅读我们的文档
在 Playground 上试用
引用
请按以下格式引用本文:
Liquid AI, "LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge", Liquid AI Blog, Aug 2026.
1 评估使用 vLLM 0.26.0 以及各模型推荐的生成参数(如有)进行。所有地方均使用非推理模式,并提示模型直接作答而不进行推理。
表中的所有数值均归一化到 0–100。原始基准测试中,MME 使用 0-2800,OCRBench 使用 0-1000,DocVQA 和 InfographicVQA 使用 0–1。
RefCOCO-avg 是以下 8 个划分上 P@1 的平均值:RefCOCO: val, testA, testB,RefCOCO+: val, testA, testB,RefCOCOg: val, test
POPE 是 adversarial、popular 和 random 子集中所有样本的 F1
MMMU-Pro 使用 10 选项的多选题变体
2 InternVL 3.5 模型不支持函数调用。
来源:Liquid AI Blog · liquid.ai