Liquid AI 发布 LFM2.5 系列 Q4_0 量化感知蒸馏检查点
LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment
Liquid AI 发布 LFM2.5-230M、350M、1.2B-Instruct 和 2.6B 的 4-bit 检查点,采用量化感知蒸馏(QAD)训练,在 Hugging Face 上线。
原文给出四个尺寸的量化检查点与逐项恢复数据,可据此判断端侧部署中精度与吞吐的取舍。
今天,我们发布了 LFM2.5-230M、LFM2.5-350M、LFM2.5-1.2B-Instruct 和 LFM2.5-2.6B 的更新版 4-bit checkpoints,它们使用量化感知蒸馏(QAD)训练。QAD 是一种将高精度教师模型蒸馏到量化学生模型中的技术。这些 checkpoints 保留了 Q4_0 GGUFs 的低内存占用和高吞吐量,同时恢复了大部分因量化而损失的精度:四个模型的平均分都达到了其 BF16 平均分的约 97%。
QAD GGUFs 现已在 Hugging Face 上提供:LFM2.5-230M、LFM2.5-350M、LFM2.5-1.2B-Instruct 和 LFM2.5-2.6B。
基准测试
对于全部四个模型,我们在涵盖推理、指令遵循、工具使用和智能体能力的基准测试套件上,将使用训练后量化(PTQ)生成的已发布 GGUFs 与训练后的 QAD Q4_0 checkpoints 进行比较:GPQA Diamond、MMLU-Pro、IFEval、IFBench、Multi-IF 和 BFCLv4。BF16 GGUF 作为同格式的上限。我们还添加了一个规模适配的数学评估:LFM2.5-230M 和 LFM2.5-350M 使用 GSM8K,LFM2.5-1.2B-Instruct 和 LFM2.5-2.6B 使用 AIME25。我们报告五次重复的平均值。
在不同模型规模上,QAD 显著改善了 Q4_0 checkpoint,最强的恢复通常出现在较小模型中,因为 PTQ Q4_0 在这些模型中造成更大的相对质量损失。我们将恢复量化为 QAD 弥合的 BF16 到 Q4_0 质量差距的比例。QAD 为 LFM2.5-230M 弥合了 70.6% 的差距,为 LFM2.5-350M 弥合了 73.4%,为 LFM2.5-1.2B 弥合了 65.5%,为 LFM2.5-2.6B 弥合了 48.4%。由此得到的 checkpoints 分别保留了其各自 BF16 基线性能的 97.1%、96.5%、97.4% 和 96.6%。
部署权衡
为了从部署角度说明恢复效果,我们绘制了七任务平均基准分数与 llama.cpp 解码吞吐量的关系,吞吐量以每秒 token 数衡量,覆盖四种硬件后端。QAD Q4_0 使用原生 Q4_0 吞吐量,因为这两个 checkpoints 具有相同的 GGUF 格式、张量布局和运行时路径。
- MacBook Pro:在 Apple M5 Max 上进行 GPU 推理;在 256-token 提示词预填充后生成 100 个 token。图中显示了 BF16 和 F16 参考点。
- NucBox EVO-X2:在 AMD Ryzen AI Max+ 395 上进行 GPU 推理;在 256-token 提示词预填充后生成 100 个 token。图中显示了 BF16 和 F16 参考点。
- Samsung Galaxy S26 Ultra:在 Qualcomm Snapdragon 8 Elite Gen 5 上进行 Arm CPU 推理;在 256-token 提示词预填充后生成 100 个 token。图中显示了 BF16 和 F16 参考点,其中 F16 作为实际的全精度参考。
- Raspberry Pi 5:在 Broadcom BCM2712 上进行 Arm CPU 推理。对于 230M、350M 和 1.2B 模型,吞吐量使用更短的仅解码运行测量,即不进行预填充、生成 32 个 token,并以 F16 作为全精度参考。
原生情况下,Q4_0 在质量方面是最弱的 4-bit 格式,但在我们的后端中速度最快。这正是 QAD 所针对的权衡。QAD Q4_0 在 230M 和 350M 上于运行间方差范围内匹配 Q5_K_M 质量,在 1.2B 上差距不到半分,同时体积更小、速度更快。
它还优于标准 4-bit 选项 Q4_K_M,并且匹配 Unsloth 的 UD-Q4_K_XL,这是一个强大的外部训练后量化 checkpoint。
开始使用
QAD GGUF 现已在 Hugging Face 上提供:LFM2.5-230M、LFM2.5-350M、LFM2.5-1.2B-Instruct 和 LFM2.5-2.6B。
引用
如需引用,请使用以下参考文献或 BibTeX:
Liquid AI,“LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment”,Liquid AI Blog,2026 年 8 月。
来源:Liquid AI Blog · liquid.ai