Liquid AI 发布 LFM2.5-350M 小模型
LFM2.5-350M: No Size Left Behind
Liquid AI 发布 LFM2.5-350M,在 LFM2 架构上把预训练数据从 10T 扩到 28T tokens 并加入大规模强化学习,主打工具调用、数据抽取和结构化输出。
350M 参数模型在工具调用与数据抽取上超过两倍规模模型,并给出多硬件推理速度,可据此判断端侧小模型的可用边界。
今天,我们发布 LFM2.5-350M,这是我们 350M 模型的改进版本,增加了额外的预训练(从 10T 到 28T tokens)以及大规模强化学习。它基于 LFM2 架构构建,提供极快的推理速度,并且可以在任何地方运行,从云端 GPU 到廉价 CPU。它擅长工具使用、数据提取和结构化输出——全部在 350M 参数下实现——使其专为边缘端的大规模数据处理和函数调用而打造。
为了在开发者所在之处满足他们,我们确保我们的模型能够在他们偏好的推理引擎以及 CPU、NPU 和 GPU 硬件上无缝运行。我们非常高兴地欢迎 Zetic、RunAnywhere 和 Mirai 加入我们的本地 AI 生态系统,与 AMD、Qualcomm Technologies、Intel、LM Studio 和 Cactus Compute 一起,推动在车辆、智能手机、笔记本电脑、IoT 和嵌入式系统中的稳健边缘部署。此外,我们与 Distil Labs 的新合作使团队能够仅使用模型轨迹,轻松微调高效的 LFM 模型,以替代昂贵且缓慢的 LLM。
基础模型(LFM2.5-350M-Base)和后训练模型(LFM2.5-350M)现已在 Hugging Face、LEAP 和我们的 Playground 上提供。请查看我们的 docs,了解如何在本地运行和微调它们。
基准测试
我们在十个基准测试中评估了 LFM2.5-350M,涵盖核心能力和应用任务。它在知识(GPQA Diamond、MMLU-Pro)和指令遵循(IFEval、IFBench、Multi-IF)等核心能力上优于规模超过其两倍的模型,在数据提取(CaseReportBench)和工具使用(BFCLv3、BFCLv4、𝜏²-Bench Telecom 和 Retail)等特定任务上也是如此。
模型 | GPQA Diamond | MMLU-Pro | IFEval | IFBench | Multi-IF |
|---|---|---|---|---|---|
LFM2.5-350M | 30.64 | 20.01 | 76.96 | 40.69 | 44.92 |
LFM2-350M | 27.58 | 19.29 | 64.96 | 18.20 | 32.92 |
Granite 4.0-H-350M | 22.32 | 13.14 | 61.27 | 17.22 | 28.70 |
Granite 4.0-350M | 25.91 | 12.84 | 53.48 | 15.98 | 24.21 |
Qwen3.5-0.8B (Instruct) | 27.41 | 37.42 | 59.94 | 22.87 | 41.68 |
Qwen3.5-0.8B (Thinking) | 19.29 | -* | 32.93 | 22.00 | 26.44 |
Gemma 3 1B IT | 23.89 | 14.04 | 63.49 | 20.33 | 44.25 |
模型 | CaseReportBench | BFCLv3 | BFCLv4 | 𝜏²-Bench Telecom | 𝜏²-Bench Retail |
|---|---|---|---|---|---|
LFM2.5-350M | 32.45 | 44.11 | 21.86 | 18.86 | 17.84 |
LFM2-350M | 11.67 | 22.95 | 12.29 | 10.82 | 5.56 |
Granite 4.0-H-350M | 12.44 | 43.07 | 13.28 | 13.74 | 6.14 |
Granite 4.0-350M | 0.84 | 39.58 | 13.73 | 2.92 | 6.14 |
Qwen3.5-0.8B (Instruct) | 13.83 | 35.08 | 18.70 | 12.57 | 6.14 |
Qwen3.5-0.8B (Thinking) | 0.39 | 39.64 | 25.39 | 14.33 | 7.02 |
Gemma 3 1B IT | 2.28 | 16.61 | 7.17 | 9.36 | 6.43 |
* 由于 doom looping,评估无法完成。
与 LFM2-350M 相比,三项能力有显著提升:指令遵循(IFBench 18.20 → 40.69)、数据提取(CaseReportBench 11.67 → 32.45)和工具使用(BFCLv3 22.95 → 44.11)。
这使 LFM2.5-350M 成为驱动大规模数据提取流水线或轻量级设备端智能体流水线的理想解决方案。但是,不建议将其用于数学、代码和创意写作等任务。
随处快速推理
LFM2.5-350M 从第一天起就支持整个推理生态系统:
- LEAP — Liquid 的边缘 AI 平台,用于 iOS 和 Android 部署
- llama.cpp — 用于高效边缘推理的 GGUF 检查点
- MLX — 针对 Apple Silicon 的优化推理
- vLLM — 面向生产吞吐量的 GPU 加速服务
- SGLang — 面向生产吞吐量的 GPU 加速服务
- ONNX — 跨多种加速器的跨平台推理
- OpenVino — 面向 Intel 硬件的优化与部署工具包
CPU 推理。得益于高效的 LFM2 架构,LFM2.5-350M 的速度显著快于同等规模的模型,包括 SSM 混合模型(Granite-4.0-H-1B)和 Gated Delta Networks(Qwen3.5-0.8B)。
GPU 推理。为支持大数据处理,我们支持 vLLM 和 SGLang 等高吞吐量推理引擎。我们在单块 NVIDIA H100 SXM5 GPU 上以持续负载设置测量输出吞吐量(总输出 token 数 / 墙钟时间):在每个并发级别下,我们持续维持目标数量的在途请求(一个请求完成后,立即发送另一个请求来替代它)。
每个模型均使用 SGLang 0.5.9 在 1 到 4,096 的并发级别下进行基准测试,使用 1,024 个输入 token 和最多 256 个输出 token(max_tokens=256),BF16 精度。我们将每个实验重复 3 次并报告平均吞吐量。LFM2.5-350M 在该规模类别的模型中实现了最高峰值吞吐量,在高并发下达到每秒 40.4K 输出 token——相当于在单块 H100 上每天超过 3.5B token。
Liquid 合作伙伴生态持续扩展
为确保 LFM2.5 系列在你需要的任何地方都能高效、有效地运行,我们正在快速扩展我们的硬件和软件生态。今天,我们非常高兴地欢迎一批多元化的合作伙伴,从 Mirai、Zetic 和 Runanywhere 等芯片领导者和优化运行时,到 Distil Labs 等定制化合作伙伴。无论你是针对特定工作流进行微调,还是在移动 NPU 和边缘设备上部署,我们的生态都能赋能开发者选择他们偏好的环境并快速上手。
面向生产环境的定制化:Distil Labs
为了突破我们全新 350M 模型的极限,我们与 Distil Labs 合作,在真实世界的智能体工作流上对 LFM2.5 进行基准测试。通过针对智能家居、银行和基于终端的用例中的多轮交互对模型进行微调,他们在工具调用可靠性上实现了巨大飞跃,在整个对话过程中达到超过 95% 的准确率。这一结果证明,LFM2.5 不仅速度快;它还能高度胜任生产级 AI 智能体所需的复杂来回交互。
芯片与软件优化合作伙伴
为了将 LFM2.5 带到边缘,我们与领先的芯片和软件合作伙伴合作,在 CPU、GPU 和 NPU 上优化这些模型。
AMD:我们与 AMD 的合作确保 LFM2.5-350M 针对其 Ryzen™ AI 硬件进行了全面优化。通过利用 Ryzen™ AI 推理引擎,我们在 CPU、GPU 和 NPU 上提供高效的本地体验。
“AMD 很自豪能为 LFM2.5-350M 提供首日支持。我们的 Ryzen™ AI 处理器为这一紧凑而强大的模型的本地部署提供了理想平台。”
Qualcomm Technologies:为了充分释放 Qualcomm SoC 的潜力,我们与 Qualcomm Technologies、Zetic 和 Runanywhere 展开合作。Zetic 的 Melange 执行层为 LFM2.5 350M 在 Qualcomm Snapdragon® 设备上提供 Day 0 支持。这使开发者能够立即利用 Qualcomm CPU、GPU 和 NPU 进行快速的端侧推理,无需自定义优化。除 Zetic 外,RunAnywhere 进一步扩展了我们的 Snapdragon 覆盖范围,为开发者提供专为 Hexagon 架构量身定制的无缝、优化执行。
“LiquidAI 通过其 LFM2.5-350M 模型所取得的成果,有力地验证了我们在 Qualcomm Technologies 一直构建的端侧 AI 路线,”Vinesh Sukumar,Qualcomm Technologies, Inc. 产品管理副总裁兼 Gen AI/ML 负责人表示。“他们的架构独特地适配移动和边缘部署的约束,当你在 Qualcomm® Hexagon™ NPU 上运行它时,数字会说明一切——低延迟、低内存占用,以及可与数倍于其规模的模型相媲美的推理质量。这一发布明确表明,高效 AI 与强大 AI 不再是取舍关系”。
Intel 通过原生 OpenVINO 优化为 LFM2.5 350M 带来加速性能。这些即用型模型旨在最大化 Intel 硬件上的推理速度,现已在 Hugging Face 上提供。
“我们很高兴将 Liquid AI 的 LFM 2.5 350M 的强大能力带入 Intel 生态系统。通过集成原生 OpenVINO 优化,我们使开发者能够在 Intel 驱动的边缘和 AI PC 环境中实现卓越的推理速度和高效的内存管理。”
Apple Silicon 生态系统:在 Mirai 引擎的驱动下,LiquidAI 的 LFM2.5-350M 在整个 Apple Silicon 生态系统中提供极快的端侧推理。基准测试展示了从移动端 A18 Pro 芯片到桌面级 M1 至 M5 Max 处理器等硬件上的卓越生成速度。
低内存边缘设备:为证明高性能并不需要高端硬件,Cactus Compute 展示了 LFM2.5 350M 在 低于 300 美元的设备(如 iPhone 13 Mini、Google Pixel 6a 和 Raspberry Pi 5)上运行得异常快速。Cactus Engine 通过针对受限边缘环境大幅优化 RAM 使用来实现这一点。
通用本地部署:最后,LM Studio 为 LFM2.5 350M 提供 Day 0 支持。开发者可以使用 llmster——LM Studio 的无头守护进程——在其本地边缘设备上无缝运行该模型,使本地实验和部署变得轻而易举。
LFM2.5-350M 推理速度基准测试
设备 | 推理 | 框架 | 预填充 (tok/s) | 解码 (tok/s) | 峰值内存 |
|---|---|---|---|---|---|
AMD Ryzen™ AI Max 395+ | CPU | llama.cpp (Q4) | 2.9K | 313 | 434MB |
Qualcomm Snapdragon® 8 Elite For Galaxy (Samsung Galaxy S25 Ultra) | NPU | RunAnywhere (Q4) | 2.8K | 15 | 169MB |
Qualcomm Snapdragon® 8 Elite For Galaxy (Samsung Galaxy S25 Ultra) | GPU | RunAnywhere (Q4) | 5.3K | 62 | 81MB |
Apple A18 Pro | GPU | Mirai (bf 16) | 1953 | 73 | 945 |
Apple M1 Max | GPU | Mirai (bf 16) | 10.4K | 328 | 940MB |
Apple M5 Max | GPU | Mirai (bf 16) | 44.8K | 564 | 1GB |
Apple iPhone 13 Mini | CPU | Cactus Engine (int 8) | 496 | 88 | 56MB |
Google Pixel 6a | CPU | Cactus Engine (int 8) | 208 | 42 | 328MB |
Raspberry Pi5 | CPU | Cactus Engine (int 8) | 200 | 30 | 300MB |
速度数据基于 1K 预填充和 100 个解码 token
开始使用
立即使用 LFM2.5-350M 和 LFM2.5-350M-Base 开始构建,现已上线
Hugging Face
LEAP
在 Liquid Playground 上试用
借助 LFM2.5,我们正在实现让 AI 随处运行的愿景。这些模型:
- 开放权重 — 可自由下载、微调和部署,无任何限制
- 开箱即快 — 原生支持 llama.cpp、NexaSDK、MLX 和 vLLM,覆盖 Apple、AMD、Qualcomm 和 Nvidia 硬件
- 完整家族 — 从用于定制的基座模型到专门的音频和视觉变体,一种架构覆盖多种用例
边缘 AI 的未来已来。我们迫不及待想看到你的作品。
引用
请按以下格式引用本文:
Liquid AI, "LFM2.5-350M: No Size Left Behind", Liquid AI Blog, Mar 2026.
来源:Liquid AI Blog · liquid.ai