Liquid AI 发布决策模型 d1,新增图像输入支持
Introducing d1: The most capable decision model, now with vision
Liquid AI 发布首个决策模型 d1,在文本之外新增图像输入支持,已在 console.liquid.ai 和 d1 Playground 上线。d1 以一次前向传播直接输出概率,不生成 token,文本决策耗时 200 至 300 毫秒,支持是/否、多选和打分三类问题。
官方给出 d1 决策模型的定价、延迟与多任务对比数据,可据此判断决策模型替代 LLM 调用的适用边界。
今天,我们推出 d1,我们的首个决策模型,现已支持文本和图像。通过上周的实验性发布,d1 成为首个在文本决策上可与 Jev 匹敌的模型,如今它又成为首个将这些能力扩展到图像的模型。你今天就可以在console.liquid.ai 和 d1 Playground 中试用。
我们在六个真实应用场景中将 d1 与 GPT-6.1 Sol 和 Claude Opus 5.5 进行了对比测试,从筛选支持工单到检查电路板。在其中四个场景中,d1 与 GPT-6.1 Sol 持平或胜出。它的成本比这两个模型低 19 倍到 200 倍,并且在每项任务上都显著更快。
d1 决策模型如何工作
决策模型针对某一情境,为每个可能的答案给出一个概率。d1 决策模型以非结构化数据(例如文本、图像或两者兼有)以及一个或多个问题作为输入,在一次前向传播中读取它们,并返回概率,而不生成任何 token。一次文本决策耗时 200 到 300 毫秒,快到足以用于实时应用。
d1 回答三类问题:
- Noul:一个是/否问题,用 0 到 1 之间的概率作答。
- Choice:从多个标签中选出一个,用每个标签的概率作答。
- Score:在一个量表上的位置,按每个等级的概率加权。
一个请求可以针对同一状态提出多个问题,从而节省输入 token。
d1 实战
当答案是结构化决策时,决策模型可以替代对语言模型的高昂调用。它们还能开启各种新的用例,本节展示了其中一些。下面的每个演示都在 d1 Playground 中实时运行。
视觉检测。这个工业应用检查来自四条产线、从摄像头下经过的零件:电路板、蜡烛、腰果和口香糖(公开的 VisA 数据集)。d1 以 85-97% 的准确率分拣合格与缺陷零件。最有趣的一点是,该模型从未为此训练过。得益于其出色的泛化能力,它能从一段简短描述中理解任务。
文本应用。五个应用将 d1 用于每一项决策:
- Smart Filter:d1 成为 SQL 查询中的一个函数,
WHERE d1(ticket, 'the customer wants to cancel)。它为 150 个支持工单逐一回答是或否。 - Code Search:d1 逐个文件夹地浏览 Hugging Face transformers 仓库(6,511 个文件),一直深入到能回答问题的那个函数。
- Smart Folders:d1 将每个新文档归入一个文件夹,再归入一个子文件夹。它以同样的方式归档搜索问题,因此关键词搜索只需查看一个子文件夹。
- Web Agent:d1 根据一句目标描述操作一个航班搜索网站。每一步,它都会在页面允许的所有操作中选出下一个动作。
- Context Compaction:d1 读取编码智能体会话中的每个工具输出,并为下一个任务保留、裁剪或丢弃它。它移除了 52% 的 token,同时保留了任务所需的每一个输出。
我们从以下开源项目中改编了其中四个应用: pg-jev、 jevgrep、 jev-ultrafast 和 fast-jev-compaction。
游戏。d1 实时玩八款经典游戏,并选择每一步。视觉在两方面帮助它:
- 更优决策:俄罗斯方块完全可以用文字描述,但加入屏幕画面后,d1 的得分从消除 70 行提升到 81 行。
- 更简单的集成:在 Wordle 中,d1 直接从截图读取棋盘。开发者无需编写游戏的文字版本,而 d1 仍以平均 3.8 次猜测解决了 12 局中的 12 局。
d1 也能处理纯视觉任务。在 Quick, Draw! 中,它能在 62 个词中猜出玩家的涂鸦内容,6 幅画中能识别出 5.2 幅(随机猜测为 0.6)。
可用性与定价
立即使用 d1 决策模型开始构建,该模型已在 Liquid AI API 上以 d1 形式提供。在 console.liquid.ai 创建 API 密钥(Dashboard > API Keys)。
要使用视觉功能,您只需在 images 中以 base64 数据 URL 的形式发送图像:
import base64, os, requests
image = base64.b64encode(open("board.jpg", "rb").read()).decode()
response = requests.post(
"https://api.liquid.ai/decisions/v1/systemone",
headers={"Authorization": f"Bearer {os.environ['LIQUID_API_KEY']}"},
json={
"model": "d1",
"images": [f"data:image/jpeg;base64,{image}"],
"state": "Camera image of a circuit board on the production line.",
"questions":
{"defect": {
"type": "noul",
"instructions": "Does this circuit board have a defect?"
}
},
},
)
print(response.json()["answers"]["defect"]["noul"])完整的 API 参考文档见 决策模型文档。
d1 仅按输入 token 计费,无输出 token。图像按与文本相同的费率计为输入 token:每 32×32 像素块 1.5 个 token,因此一张 1024×1024 的图像计费 1,536 个 token。每个问题作为独立的提示计费,包括其文本和所有图像。
d1 也可通过 Vercel 和 OpenRouter 使用,目前仅支持文本。视觉功能即将登陆这两个平台。
这是 AI 领域创意与探索的激动人心的时刻,而 d1 仅仅是开始。我们正在继续研发各种规模的决策模型,带来新功能、更高的决策质量和更低的延迟,并计划很快在 Hugging Face 上发布即将推出的模型的开源权重。
引用
如需引用,请使用以下参考文献或 BibTeX:
Liquid AI,“Introducing d1: The most capable decision model, now with vision”,Liquid AI Blog,2026 年 10 月。
方法说明。我们于 2026 年 10 月 5 日使用 d1 Playground 的比较脚本对每个模型各运行一次每个应用。GPT-6.1 Sol 和 Claude Opus 5.5 将每个请求作为一条聊天消息接收并以 JSON 格式回答,使用其默认推理设置。当多个问题共享一个输入时,例如过滤器的工单或文件夹的段落,聊天模型会分批回答。成本使用标价,不含提示缓存折扣。d1 的成本按每百万输入 token 0.04 美元计算。时间为每次运行的时间,最多 8 个请求并发。一次智能过滤器运行是对 150 个工单的一次查询。一次智能文件夹运行归档 105 个段落,其成本按每 1,000 个段落计算。过滤器的质量是其相对于人工标注的 F1 分数,同时计入漏匹配和错匹配。其他文本应用统计正确处理的目标、问题、段落或所需输出。我们在 d1 的流水线设定后编写了 15 个代码问题中的 6 个和 4 个压缩会话中的 2 个。在视觉检查中,每个模型都会看到来自同一产线的良品部件与待检查部件并排展示。
来源:Liquid AI Blog · liquid.ai