Liquid AI 发布 LFM2.5-2.6B 端侧智能体模型
LFM2.5-2.6B: Deploy Agents Everywhere
Liquid AI 发布 LFM2.5-2.6B,一款完全在设备端运行的智能体模型,基座版与后训练版已在 Hugging Face 上线。模型预训练约 34T tokens,词表扩展至 128K,后训练经 SFT、教师专精、多域在线策略蒸馏(MOPD)与 Agentic RL 四阶段,支持 128K 上下文。
2.6B 端侧智能体模型的完整训练管线与跨尺寸基准对比,可据此判断本地 Agent 的可行边界。
今天,我们发布 LFM2.5-2.6B,一个完全在设备端运行的智能体模型。它小到可以在手机上运行,快到可以在 CPU 上保持响应,并且足以驱动智能体工作流:规划、调用工具以及处理多步骤任务。
与依赖云端 API 的智能体不同,本地智能体为你提供免费推理、低延迟和真正的隐私保护。取消按 token 计费改变了开发者的构建方式:智能体现在可以在本地硬件上大规模并行运行,执行后台任务,消耗数百万 token 而无需边际成本。当 token 开销不再是约束时,智能体就可以全天候地运行在任何地方。
基础模型(LFM2.5-2.6B-Base)和后训练模型(LFM2.5-2.6B)今天已在 Hugging Face 上发布。请查看我们的 文档,了解如何在本地运行和微调它们。
训练
LFM2.5-2.6B 是一个 2.6B 参数的模型,专为智能体工作负载训练。它在约 34T token 上进行了预训练。为了更好地支持 LFM2.5 中的非拉丁文字,我们通过就地扩展现有分词器将词表翻倍至 128K,而不是从头重新训练模型,使用的流程与 LFM2.5-8B-A1B 相同。中期训练包含一个专门的 128K 上下文扩展阶段,使模型能够处理智能体工作负载所需的长输入。
该示意图总结了将 LFM2.5-2.6B-Base 转变为智能体模型 LFM2.5-2.6B 的四阶段后训练流程:监督微调(SFT)、教师专业化、多领域同策略蒸馏(MOPD)以及智能体强化学习(Agentic RL)。
监督微调。后训练从两个连续的 SFT 阶段开始:先覆盖所有领域的广泛内容,然后针对智能体任务、推理和工具使用等优先技能进行定向塑造。在这两个阶段中,SFT 训练混合数据量约为 LFM2.5-8B-A1B 所用数据量的七倍,并更侧重于工具使用、网络搜索、软件工程和智能体轨迹等智能体任务。最终的 SFT 检查点既作为学生模型,也作为后续蒸馏阶段训练一组专家教师的初始化检查点。
教师专业化。从共享的 SFT 检查点出发,我们通过一轮聚焦的 SFT 在重新加权的混合数据上为每个目标领域训练一个专家,随后使用可验证奖励的强化学习(RLVR)。由此产生的专家覆盖指令遵循、数学、知识(包括幻觉控制)、代码、工具使用和长上下文。将它们分开训练可以让每个专家使用针对性的数据和奖励,为其自身领域进行深度优化,而不会受到无关目标的更新竞争。
MOPD。然后,我们使用这些专业化专家作为教师,将其能力蒸馏到单个学生模型中。与离策略蒸馏(学生从另一个模型生成的轨迹中学习)不同,MOPD 让学生在自己的策略下进行 rollout。每个提示都会被路由到对应领域的教师,教师以 token 级反馈监督学生的响应。
由于教师模型与学生模型源自同一个 SFT 检查点,它们的反馈与学生模型的分布足够接近,从而能够引导学习而不会破坏训练的稳定性。这种密集的、路由式的监督帮助学生模型快速收敛,同时将领域专用的能力整合到单一模型中。
智能体强化学习。 最后一个阶段教会模型在真实的智能体环境中运行。我们通过真实的智能体框架运行多轮智能体强化学习,模型在其中处理贴近现实的生产力任务,评估其研究、写作、编码、数据分析、文档管理、使用外部工具以及自动化多步骤工作流的能力。
在训练过程中,我们采样一个任务并随机选择相应的框架。每次 rollout 都在拥有独立运行时的专用沙箱中运行。我们使用 GRPO 进行优化,采用基于结果的奖励,该奖励结合了 LLM 作为评判者的评分标准、程序化检查以及硬性安全门控。直接在 Hermes Agent、OpenClaw 及其他框架中进行训练,使模型接触到它们的工具、系统提示和交互模式,帮助其在各种智能体环境中可靠工作。
训练流水线将模型优化、推理和环境执行分离为不同的组件。训练引擎(FSDP)优化模型,而Rollout 引擎(SGLang)使用最新策略生成动作。强化学习框架(verl)通过启动 rollout、收集轨迹和奖励以及更新模型来编排训练循环。
动作在沙箱服务中执行,其中黑盒框架托管智能体(例如 OpenClaw 或 Hermes Agent),并通过工具调用、代码执行及其他任务特定操作来协调与任务环境的交互。框架代理让我们能够将智能体框架视为无需修改的黑盒,同时透明地捕获重建和验证强化学习训练样本所需的 token 级轨迹。这包括线性轨迹一致性、token 不匹配检查以及 Rollout Routing Replay(R3)。
基准测试
我们在涵盖 STEM、指令遵循、工具使用和智能体工作流的基准测试中评估了 LFM2.5-2.6B。尽管它是比较中规模最小的模型,但它与规模近四倍于它的模型相比具有竞争力,且常常表现更优。
基准测试 | LFM2.5-2.6B (2.6B) | gemma-4-E2B-it (5.1B) | gemma-4-E4B-it (8B) | Qwen3.5-4B (4.7B) | Qwen3.5-9B (9.7B) |
AA-Omniscience-Public | -29.50 | -74.47 | -49.03 | -54.30 | -50.43 |
AIME25 | 51.87 | 26.33 | 34.27 | 49.33 | 56.07 |
LiveCodeBenchv6 | 59.41 | 54.92 | 63.77 | 60.85 | 69.86 |
IFBench | 59.17 | 34.08 | 39.24 | 48.40 | 56.47 |
Multi-IF | 80.07 | 69.44 | 77.35 | 55.67 | 62.55 |
IFStruct | 85.49 | 64.85 | 76.65 | 36.25 | 78.50 |
BFCLv4 | 56.88 | 36.98 | 46.39 | 50.56 | 60.13 |
ToolSandbox | 77.83 | 52.40 | 65.00 | 75.55 | 76.44 |
τ³-Bench Banking | 5.67 | 3.35 | 4.12 | 5.45 | 5.15 |
Claw-Eval 平均(英文) | 62.85 | 53.14 | 58.02 | 62.28 | 66.53 |
PinchBench | 68.22 | 44.24 | 55.09 | 71.26 | 71.45 |
BrowseComp+ (OpenClaw) | 26.89 | 8.31 | 15.90 | 24.46 | 27.23 |
LFM2.5-2.6B 在每一项指令遵循基准测试以及几乎每一项工具使用基准测试中都处于领先,仅在 BFCLv4 上落后于 Qwen3.5-9B。在智能体任务上,它全面优于两个 Gemma 模型,并与 Qwen 模型互有胜负。在 STEM 方面,它在 AA-Omniscience-Public 上领先,在数学上仅落后于 Qwen3.5-9B。编码是较大模型仍保持优势的唯一领域。
这些结果使 LFM2.5-2.6B 非常适合边缘设备上的高并发智能体工作负载,尤其是在速度、隐私和本地部署至关重要的情况下。对于更复杂的智能体任务或编码密集型工作负载,较大的模型可能仍是更好的选择。1
随处快速推理
LFM2.5-2.6B 在发布首日即获得整个推理生态系统的支持:
- llama.cpp — 用于高效边缘推理的 GGUF 检查点
- MLX — 针对 Apple Silicon 优化的推理
- vLLM — 面向生产吞吐量的 GPU 加速服务
- SGLang — 面向生产吞吐量的 GPU 加速服务
- ONNX — 跨多种加速器的跨平台推理
CPU 推理。得益于高效的 LFM2 架构,LFM2.5-2.6B 是我们测试过的读取提示和生成答案最快的模型,在 M5 Max 上解码速度达 220 tokens/s,在 Ryzen AI Max+ 395 上达 113 tokens/s,同时内存占用保持在 2.5 GB 以下。它甚至在手机上也能保持 30 tokens/s,因此一个能力强大的智能体可以在你自己的设备上即时、私密地运行。
GPU 推理。我们还在单块 NVIDIA H100 SXM5 GPU 上使用持续负载设置测量输出吞吐量(总输出 tokens / 实际耗时):在每个并发级别下,我们持续维持目标数量的在途请求,每完成一个请求就立即替换。
我们使用 SGLang 0.5.16 对每个模型进行基准测试,输入 1,024 个 tokens,输出最多 256 个 tokens,采用 BF16 精度,每个并发级别平均运行 3 次。LFM2.5-2.6B 是其规模级别中最快的模型,在高并发下达到近 15K 输出 tokens 每秒,单块 H100 上每天约 1.3B tokens。
使用 LFM2.5-2.6B 运行本地智能体
LFM2.5-2.6B 的规模、速度和能力使其成为边缘设备上高负载智能体工作负载的绝佳选择。在下面的演示中,我们在手机上将其运行于 Liquid Agent 框架内,它完全在设备端规划、调用工具并完成一项真实任务,无需任何云端 API 调用。
搭建你自己的本地智能体只需两步。首先,在兼容 OpenAI 的端点后部署 LFM2.5-2.6B,然后让你的智能体框架指向它。它开箱即用,兼容 Hermes Agent、OpenClaw 和 Pi 等流行框架。查看我们的指南,了解如何在本地部署该模型并将其与你选择的智能体框架连接。
开始使用
立即使用 LFM2.5-2.6B 和 LFM2.5-2.6B-Base 开始构建,已在 Hugging Face 上提供。
借助 LFM2.5,我们正在实现让 AI 随处运行的愿景。这些模型:
- 开放权重 — 下载、微调和部署均无限制
- 发布首日即快速 — 原生支持 llama.cpp、MLX 和 vLLM,覆盖 Apple、AMD、Qualcomm 和 NVIDIA 硬件
- 完整家族 — 从用于定制的基座模型到专门的音频和视觉变体,一种架构覆盖多种用例
我们迫不及待想看到你的作品。
在 Hugging Face 上下载
阅读我们的文档
在 Playground 上试用
引用
请按以下格式引用本文:
Liquid AI, "LFM2.5-2.6B: Deploy Agents Everywhere", Liquid AI Blog, Aug 2026.
1 所有模型均使用 vLLM 及以下生成参数进行评估:
- BFCLv4:temperature = 0.001,最大输出 tokens = 4096。
- ToolSandBox:temperature = 0,最大输出 tokens = 1024。
- PinchBench:temperature = 0.6,最大输出 tokens = 8192。
- τ³-Bench、Claw-Eval:temperature = 0,无输出限制。Qwen 模型使用 temperature = 0.6(按推荐设置),因为贪婪解码会因 doom looping 导致性能下降。
- 其他评估:temperature = 0.6,max output tokens = 32768。
来源:Liquid AI Blog · liquid.ai