Liquid AI 发布 d1-3B 与 d1-omni-600M 开放权重决策模型
Open d1: Edge decision models for text, vision, and audio
Liquid AI 发布 d1 决策模型家族的两款开放权重模型 d1-3B 和 d1-omni-600M,均已在 Hugging Face 上线。
官方给出两款开放权重决策模型的基准与端侧延迟数据,可据此判断小模型在边缘实时决策中的可用性。
今天,我们发布 d1-3B 和 d1-omni-600M,这是我们 d1 决策模型系列中的两个开放权重模型。
d1-3B 在 Decision Index v0.2.1(公开划分)上得分为 48.57,领先于所有 10B 以下的模型,并与 Decider 35B-A3B 持平,后者是一个规模为其 12 倍的决策模型。它运行完整的 NVIDIA 技术栈,从数据中心的 DGX 到边缘的 Jetson:d1-3B 在 NVIDIA GeForce RTX 4090 上 8 毫秒回答一个问题,在 Jetson AGX Thor 上 16 毫秒,在 Jetson AGX Orin 上 26 毫秒。即使是 Jetson Orin Nano 也能在 50 毫秒内运行它,快到足以在最小的边缘硬件上实现实时决策。
d1-omni-600M 是我们的首个实验性检查点,可同时处理文本与图像,以及文本与音频。它在同一指数上得分为 15.95。
d1-3B 和 d1-omni-600M 模型现已在 Hugging Face 上提供。请查看我们的文档,了解如何在本地运行它们。
架构与训练
与我们的生成式 Liquid Foundation Models(LFMs)不同,我们的 d1 决策模型不生成 token。相反,它们通过单次前向传播直接产生答案。
d1-3B 和 d1-omni-600M 基于两个非常不同的主干网络训练而成:
- d1-3B 基于 LFM2.5-VL-3B 训练,这是我们最新的 VLM,为仅解码器架构。它接受文本和图像作为输入。
- d1-omni-600M 基于 LFM2.5-Encoder-350M 训练,这是一个双向编码器。它增加了视觉和音频编码器以处理全部三种模态。它接受文本与图像,或文本与音频作为输入。
d1-3B。我们对 LFM2.5-2.6B 和 LFM2.5-VL-3B 的文本主干网络的权重取平均,以创建更好的基础模型。然后,我们用不同的随机种子和数据混合微调检查点,再将它们合并。在长输入上训练、打乱答案选项以及修复数据中的捷径,比更先进的技术带来了更大的差异。
d1-omni-600M。我们首先在决策任务上微调 LFM2.5-Encoder-350M,然后分阶段加入音频和视觉。对于音频,我们训练了一个带适配器的 FastConformer 编码器,将其连接到主干网络,然后在冻结文本主干网络的情况下微调音频编码器。对于视觉,我们采用 LFM2.5-VL-450M 的编码器,并训练一个适配器以及对主干网络进行 LoRA 更新。这些更新仅在输入包含图像时激活,视觉编码器保持冻结。然后我们微调整个模型,合并 LoRA 更新,并将权重与之前的检查点取平均,以正则化最终模型。
基准测试
文本基准测试。我们在七个公开基准测试上评估了 d1-3B 和 d1-omni-600M,涵盖阅读理解、毒性检测、意图分类、医学问答和跨语言理解。
基准测试 | d1-omni-600M | d1-3B | Decider 2B | Decider 4B |
SQuAD 2.0 | 74.0 | 85.3 | 67.7 | 76.0 |
Civil Comments | 95.8 | 93.0 | 93.6 | 92.8 |
MASSIVE intent | 86.1 | 87.3 | 81.1 | 88.3 |
PubMedQA | 61.3 | 66.0 | 65.7 | 63.3 |
BoolQ | 77.7 | 86.7 | 87.3 | 89.0 |
XNLI | 74.7 | 85.0 | 85.0 | 88.6 |
PAWS-X | 79.5 | 76.9 | 59.5 | 69.8 |
均值 | 78.4 | 82.9 | 77.1 | 81.1 |
d1-3B 以 82.9 的均值领先,为表中最高,并领先于 Decider 4B(81.1)。d1-omni-600M 达到 78.4,以四分之一的参数超越了 Decider 2B(77.1)。它还在毒性检测(Civil Comments:95.8)和释义识别(PAWS-X:79.5)上取得了表中的最高分。
视觉与音频性能。 Decision Index v0.3 包含一个私有视觉分项,本次发布中我们不予报告。取而代之的是,我们验证了 d1-3B 在标准视觉基准上保留了其 LFM2.5-VL-3B 骨干网络的视觉能力,并且 d1-omni-600M 能够处理全部三种模态。它们的视觉能力展示在下方我们的 playground 演示中。专门的音频决策基准目前仍是一个开放问题。随着多模态决策模型这一类别逐渐成熟,我们期待看到社区开发出这些基准。
随处快速推理
d1-3B 和 d1-omni-600M 可运行完整的 NVIDIA 技术栈——从数据中心的 DGX,到 RTX 工作站,再到边缘端的 Jetson——并首日支持 llama.cpp。
由于决策模型不生成输出 token,我们测量端到端延迟,即从输入到输出。我们报告 d1-3B 的推理数据。d1-omni-600M 是早期研究版本,正在积极开发中。
边缘推理。 我们在 Apple M5 Pro 上测量延迟,并与 NVIDIA 合作,在 NVIDIA Jetson AGX Thor、Jetson AGX Orin 64 GB 和 Jetson Orin Nano 上测量延迟。我们一次测量一个请求,涵盖单个问题、基于一个状态的三个问题、一个 3.4K token 的状态,以及一张 384px 图像。
一个问题 | 3 个问题 | 3.4K token 状态 | 384px 图像 | 64 个状态,打包 | |
Apple M5 Pro | 30 ms | 41 ms | 640 ms | 62 ms | 78 / s |
Jetson AGX Thor | 16 ms | 20 ms | 220 ms | 35 ms | 262 / s |
Jetson AGX Orin 64 GB | 26 ms | 35 ms | 560 ms | 83 ms | 110 / s |
Jetson Orin Nano | 50 ms | 73 ms | 1,640 ms | 202 ms | 38 / s |
d1-3B 在每台被测设备上都能在 50 ms 内回答单个问题。三个问题耗时仅为单个问题的 1.3 倍,其中 AGX Thor 从 16 ms 增至 20 ms。
GPU 推理。 我们在 NVIDIA RTX 4090 和 AMD MI325X 上测量延迟,一次一个请求,涵盖单个问题、基于一个状态的三个问题、一个 3.4K token 的状态,以及一张 384px 图像。
一个问题 | 3 个问题 | 3.4K token 状态 | 384px 图像 | 64 个状态,打包 | |
NVIDIA RTX 4090 | 8 ms | 21 ms | 102 ms | 17 ms | 475 / s |
AMD MI325X | 9 ms | 14 ms | 44 ms | 18 ms | 1,106 / s |
在 GPU 上,d1-3B 在两个平台上都能在 10 ms 内回答一个问题,并在 18 ms 内处理一张 384px 图像。
d1 开放实践
这些结果使我们的小型开放 d1 决策模型非常适合任何需要快速、结构化决策的场景,包括多模态输入。d1-3B 在其规模下提供最高的决策质量,而 d1-omni-600M 则适合对占用空间有要求的场景。
为了展示实时决策在实践中的样子,我们构建了十个演示,让开放的 d1-3B 在实时摄像头输入上循环运行,从手势控制游戏到实时内容审核,每个演示每帧只需一次推理即可读取答案。你可以在我们的 Hugging Face space 中无需任何设置即可试用它们。
与 NVIDIA 合作,我们还展示了 d1-3B 在 Isaac Sim 中导航环境,模型在硬件在环设置中由 Jetson 提供服务。
开始使用
今天就开始使用 d1-3B 和 d1-omni-600M 进行构建,它们已在 Hugging Face 上提供。
借助 d1,我们正在实现让 AI 随处运行的愿景。这些模型是:
- 开放权重——下载、微调和部署均无限制
- 开箱即快 — 原生支持 llama.cpp,覆盖 Apple、AMD、Qualcomm 和 NVIDIA,并支持 NVFP4
- 一个家族 — 两种规模,让你根据部署需求在精度与占用之间权衡。
我们迫不及待想看到你构建的作品。
在 Hugging Face 上下载 d1-3B
在 Hugging Face 上下载 d1-omni-600M
阅读 NVIDIA Jetson AI Lab 关于 d1-3B 的内容
阅读 NVIDIA Jetson AI Lab 关于 d1-omni-600M 的内容
引用
如需引用,请使用以下参考文献或 BibTeX:
Liquid AI, "Open d1: Edge decision models for text, vision, and audio", Liquid AI Blog, Oct 2026.
来源:Liquid AI Blog · liquid.ai