跳到正文
Liquid AI Blog·· 19 小时前精选AI 评分67

Liquid AI 发布 d1-3B 与 d1-omni-600M 开放权重决策模型

Open d1: Edge decision models for text, vision, and audio

AI 导读

Liquid AI 发布 d1 决策模型家族的两款开放权重模型 d1-3B 和 d1-omni-600M,均已在 Hugging Face 上线。

推荐理由

官方给出两款开放权重决策模型的基准与端侧延迟数据,可据此判断小模型在边缘实时决策中的可用性。

正文 · AI 翻译

今天,我们发布 d1-3B 和 d1-omni-600M,这是我们 d1 决策模型系列中的两个开放权重模型。 

d1-3B 在 Decision Index v0.2.1(公开划分)上得分为 48.57,领先于所有 10B 以下的模型,并与 Decider 35B-A3B 持平,后者是一个规模为其 12 倍的决策模型。它运行完整的 NVIDIA 技术栈,从数据中心的 DGX 到边缘的 Jetson:d1-3B 在 NVIDIA GeForce RTX 4090 上 8 毫秒回答一个问题,在 Jetson AGX Thor 上 16 毫秒,在 Jetson AGX Orin 上 26 毫秒。即使是 Jetson Orin Nano 也能在 50 毫秒内运行它,快到足以在最小的边缘硬件上实现实时决策。

d1-omni-600M 是我们的首个实验性检查点,可同时处理文本与图像,以及文本与音频。它在同一指数上得分为 15.95。

d1-3B 和 d1-omni-600M 模型现已在 Hugging Face 上提供。请查看我们的文档,了解如何在本地运行它们。

架构与训练

与我们的生成式 Liquid Foundation Models(LFMs)不同,我们的 d1 决策模型不生成 token。相反,它们通过单次前向传播直接产生答案。

d1-3B 和 d1-omni-600M 基于两个非常不同的主干网络训练而成:

  • d1-3B 基于 LFM2.5-VL-3B 训练,这是我们最新的 VLM,为仅解码器架构。它接受文本和图像作为输入。
  • d1-omni-600M 基于 LFM2.5-Encoder-350M 训练,这是一个双向编码器。它增加了视觉和音频编码器以处理全部三种模态。它接受文本与图像,或文本与音频作为输入。

d1-3B。我们对 LFM2.5-2.6B 和 LFM2.5-VL-3B 的文本主干网络的权重取平均,以创建更好的基础模型。然后,我们用不同的随机种子和数据混合微调检查点,再将它们合并。在长输入上训练、打乱答案选项以及修复数据中的捷径,比更先进的技术带来了更大的差异。

图 2:d1-3B 架构图

d1-omni-600M。我们首先在决策任务上微调 LFM2.5-Encoder-350M,然后分阶段加入音频和视觉。对于音频,我们训练了一个带适配器的 FastConformer 编码器,将其连接到主干网络,然后在冻结文本主干网络的情况下微调音频编码器。对于视觉,我们采用 LFM2.5-VL-450M 的编码器,并训练一个适配器以及对主干网络进行 LoRA 更新。这些更新仅在输入包含图像时激活,视觉编码器保持冻结。然后我们微调整个模型,合并 LoRA 更新,并将权重与之前的检查点取平均,以正则化最终模型。

图 3:d1-omni-600M 架构图。

基准测试

文本基准测试。我们在七个公开基准测试上评估了 d1-3B 和 d1-omni-600M,涵盖阅读理解、毒性检测、意图分类、医学问答和跨语言理解。

基准测试

d1-omni-600M

d1-3B

Decider 2B

Decider 4B

SQuAD 2.0

74.0

85.3

67.7

76.0

Civil Comments

95.8

93.0

93.6

92.8

MASSIVE intent

86.1

87.3

81.1

88.3

PubMedQA

61.3

66.0

65.7

63.3

BoolQ

77.7

86.7

87.3

89.0

XNLI

74.7

85.0

85.0

88.6

PAWS-X

79.5

76.9

59.5

69.8

均值

78.4

82.9

77.1

81.1

表 1:文本基准测试对比

d1-3B 以 82.9 的均值领先,为表中最高,并领先于 Decider 4B(81.1)。d1-omni-600M 达到 78.4,以四分之一的参数超越了 Decider 2B(77.1)。它还在毒性检测(Civil Comments:95.8)和释义识别(PAWS-X:79.5)上取得了表中的最高分。

视觉与音频性能。 Decision Index v0.3 包含一个私有视觉分项,本次发布中我们不予报告。取而代之的是,我们验证了 d1-3B 在标准视觉基准上保留了其 LFM2.5-VL-3B 骨干网络的视觉能力,并且 d1-omni-600M 能够处理全部三种模态。它们的视觉能力展示在下方我们的 playground 演示中。专门的音频决策基准目前仍是一个开放问题。随着多模态决策模型这一类别逐渐成熟,我们期待看到社区开发出这些基准。

随处快速推理

d1-3B 和 d1-omni-600M 可运行完整的 NVIDIA 技术栈——从数据中心的 DGX,到 RTX 工作站,再到边缘端的 Jetson——并首日支持 llama.cpp。

由于决策模型不生成输出 token,我们测量端到端延迟,即从输入到输出。我们报告 d1-3B 的推理数据。d1-omni-600M 是早期研究版本,正在积极开发中。

边缘推理。 我们在 Apple M5 Pro 上测量延迟,并与 NVIDIA 合作,在 NVIDIA Jetson AGX Thor、Jetson AGX Orin 64 GB 和 Jetson Orin Nano 上测量延迟。我们一次测量一个请求,涵盖单个问题、基于一个状态的三个问题、一个 3.4K token 的状态,以及一张 384px 图像。

一个问题

3 个问题

3.4K token 状态

384px 图像

64 个状态,打包

Apple M5 Pro

30 ms

41 ms

640 ms

62 ms

78 / s

Jetson AGX Thor

16 ms

20 ms

220 ms

35 ms

262 / s

Jetson AGX Orin 64 GB

26 ms

35 ms

560 ms

83 ms

110 / s

Jetson Orin Nano

50 ms

73 ms

1,640 ms

202 ms

38 / s

表 2:边缘推理

d1-3B 在每台被测设备上都能在 50 ms 内回答单个问题。三个问题耗时仅为单个问题的 1.3 倍,其中 AGX Thor 从 16 ms 增至 20 ms。

GPU 推理。 我们在 NVIDIA RTX 4090 和 AMD MI325X 上测量延迟,一次一个请求,涵盖单个问题、基于一个状态的三个问题、一个 3.4K token 的状态,以及一张 384px 图像。

一个问题

3 个问题

3.4K token 状态

384px 图像

64 个状态,打包

NVIDIA RTX 4090

8 ms

21 ms

102 ms

17 ms

475 / s

AMD MI325X

9 ms

14 ms

44 ms

18 ms

1,106 / s

表 3:GPU 推理

在 GPU 上,d1-3B 在两个平台上都能在 10 ms 内回答一个问题,并在 18 ms 内处理一张 384px 图像。

d1 开放实践

这些结果使我们的小型开放 d1 决策模型非常适合任何需要快速、结构化决策的场景,包括多模态输入。d1-3B 在其规模下提供最高的决策质量,而 d1-omni-600M 则适合对占用空间有要求的场景。

为了展示实时决策在实践中的样子,我们构建了十个演示,让开放的 d1-3B 在实时摄像头输入上循环运行,从手势控制游戏到实时内容审核,每个演示每帧只需一次推理即可读取答案。你可以在我们的 Hugging Face space 中无需任何设置即可试用它们。

与 NVIDIA 合作,我们还展示了 d1-3B 在 Isaac Sim 中导航环境,模型在硬件在环设置中由 Jetson 提供服务。

开始使用

今天就开始使用 d1-3B 和 d1-omni-600M 进行构建,它们已在 Hugging Face 上提供。

借助 d1,我们正在实现让 AI 随处运行的愿景。这些模型是:

  • 开放权重——下载、微调和部署均无限制
  • 开箱即快 — 原生支持 llama.cpp,覆盖 Apple、AMD、Qualcomm 和 NVIDIA,并支持 NVFP4
  • 一个家族 — 两种规模,让你根据部署需求在精度与占用之间权衡。

我们迫不及待想看到你构建的作品。

hugging face logo liquid AI在 Hugging Face 上下载 d1-3Bhugging face logo liquid AI在 Hugging Face 上下载 d1-omni-600Mnvidia logo阅读 NVIDIA Jetson AI Lab 关于 d1-3B 的内容nvidia logo阅读 NVIDIA Jetson AI Lab 关于 d1-omni-600M 的内容

引用

如需引用,请使用以下参考文献或 BibTeX:

Liquid AI, "Open d1: Edge decision models for text, vision, and audio", Liquid AI Blog, Oct 2026.

来源:Liquid AI Blog · liquid.ai