Liquid AI 发布 LFM2.5-VL-450M 端侧视觉语言模型
LFM2.5-VL-450M: Structured Visual Intelligence, Edge to Cloud
Liquid AI 发布 LFM2.5-VL-450M,是 LFM2-VL-450M 的升级版,新增目标检测与边界框预测、函数调用支持,并提升指令遵循与多语言图像理解。
原文给出预训练规模从 10T 扩到 28T tokens 及多项基准对比,可据此判断小模型在端侧视觉任务上的位置。
今天,我们发布 LFM2.5-VL-450M,这是 LFM2-VL-450M 的改进版本,具备 grounding 能力、更好的指令遵循能力以及函数调用支持。最终成果是一个紧凑型模型,即使在边缘硬件上也能实时将图像流转化为结构化、可执行的输出。
LFM2.5-VL-450M 已在 Hugging Face、LEAP 和我们的 Playground 上提供。查看我们的 docs,了解如何在本地运行和微调它。
新特性
与我们几个月前发布的 LFM2-VL-450M 相比,我们将 LFM2.5-VL-450M 的预训练规模从 10T tokens 扩展到 28T tokens,随后进行了专注于提升生产环境中多模态表现的后训练。特别是,我们使用偏好优化和强化学习来改进 grounding、指令遵循以及视觉-语言任务的整体可靠性。
Bounding box prediction: 0 → 81.28 on RefCOCO-M我们新增了目标检测功能,使模型能够识别图像中的物体并通过边界框定位它们。
Improved multilingual image understanding: MMMB 54.29 → 68.09, covering Arabic, Chinese, French, German, Japanese, Korean, Portuguese, SpanishLFM2.5-VL-450M 能以更高准确率处理八种语言的提示,将视觉推理扩展到全球部署,而无需单独的本地化模型。
Better instruction following: MM-IFEval 32.93 → 45.00该模型对显式约束和用户指令的响应更加灵敏,提升了在文本和视觉输入上的可控性。
致谢:Joshua Lochner 提供原始 VLM 演示
基准测试
我们在涵盖核心视觉理解、目标检测和语言推理的基准测试中评估了 LFM2.5-VL-450M。LFM2.5-VL-450M 在视觉和语言基准测试上均优于 LFM2-VL-450M,同时还新增了对边界框预测(在 RefCOCO-M 上测量)和文本函数调用(由 BFCLv4 测量)的支持。
LFM2.5-VL-450M | LFM2-VL-450M | SmolVLM2-500M | |
|---|---|---|---|
视觉 | |||
MMStar | 43.00 | 40.87 | 38.20 |
RealWorldQA | 58.43 | 52.03 | 49.90 |
MMBench (dev en) | 60.91 | 56.27 | 52.32 |
MMMU (val) | 32.67 | 34.44 | 34.10 |
POPE | 86.93 | 83.79 | 82.67 |
MMVet | 41.10 | 33.85 | 29.90 |
BLINK | 43.92 | 42.61 | 40.70 |
InfoVQA (val) | 43.02 | 44.56 | 24.64 |
OCRBench | 684 | 657 | 609 |
MM-IFEval | 45.00 | 33.09 | 11.27 |
MMMB | 68.09 | 54.29 | 46.79 |
CountBench | 73.31 | 47.64 | 61.81 |
RefCOCO-M | 81.28 | - | - |
语言(纯文本) | |||
GPQA | 25.66 | 23.13 | 23.84 |
MMLU Pro | 19.32 | 17.22 | 13.57 |
IFEval | 61.16 | 51.75 | 30.14 |
Multi-IF | 34.63 | 26.21 | 6.82 |
BFCLv4 | 21.08 | - | - |
*所有视觉基准测试分数均使用 VLMEvalKit 获得。多语言 MMMB 分数基于由 GPT-4.1-mini 从英语翻译为阿拉伯语、中文、法语、德语、日语、韩语、葡萄牙语和西班牙语的基准测试的平均值。
性能:为边缘而打造
在实际部署中,VLM 需要处理实时摄像头和图像输入,并且必须在严格的延迟预算内进行推理和行动。LFM2.5-VL-450M (Q4_0) 在整个范围内都能在预算内运行,从嵌入式 AI 模块(Jetson Orin)到迷你 PC APU(Ryzen AI Max+ 395),再到旗舰手机 SoC(Snapdragon 8 Elite)。
分辨率 | Jetson Orin | Samsung S25 Ultra | AMD 395+ Max |
|---|---|---|---|
256×256 | 233 ms | 950 ms | 637 ms |
512×512 | 242 ms | 2.4 s | 944 ms |
在 Jetson Orin 上,该模型可在 250ms 内对 512×512 图像进行推理,速度足以处理 4 FPS 视频流中的每一帧,并具备完整的视觉-语言理解能力,而不仅仅是检测。在消费级移动芯片上,它在较小分辨率下保持在 1 秒以内,使交互体验保持流畅响应。
真实世界用例:
LFM2.5-VL-450M 特别适合那些最看重低延迟、紧凑结构化输出和高效语义推理的真实世界部署。这些特性使其非常适合在计算、功耗或吞吐量受限的环境中早期采用,也适合离线运行或设备端处理对隐私很重要的场景。
工业自动化——边缘与受限环境
在计算资源受限的环境中,例如乘用车、农业机械和仓库,感知模型通常仅限于输出边界框。LFM2.5-VL-450M 更进一步,单次推理即可提供有依据的场景理解,使系统能够对场景进行语义推理,而不仅仅是检测其中的物体。这意味着在仓库通道等场景中可以获得更丰富的输出,包括工人动作、叉车移动和库存流动,同时仍能适配 Jetson Orin 等现有边缘硬件。
可穿戴设备与常开监测——设备端与隐私敏感场景
可穿戴设备和其他常开监测系统天然适合紧凑型 VLM,因为它们运行在严格的功耗、延迟和隐私约束下。智能眼镜、可穿戴助手、行车记录仪以及安防或工业监控等设备无法承受庞大的感知堆栈或持续的云端流传输。在这些场景中,高效的 VLM 可以在本地生成紧凑的语义输出,将原始视频转化为有用的结构化理解,同时保持低计算需求并保护隐私。
零售与电子商务——高吞吐量视觉处理
零售和电子商务平台运行在极高吞吐量的环境中,必须在严格的延迟和成本约束下处理数百万张产品和货架图像。目录录入、视觉搜索、产品匹配和货架合规等任务需要的不仅仅是目标检测,但更丰富的视觉理解在此规模下往往部署成本过高。LFM2.5-VL-450M 使结构化视觉推理在这些工作负载中变得切实可行,以实际生产系统所需的速度和效率提供语义输出。
开始使用
LFM2.5-VL-450M 模型现已在 Hugging Face、LEAP 和我们的 Playground 上提供。使用 LEAP Fine-Tune 将其适配到你的领域。
来源:Liquid AI Blog · liquid.ai