跳到正文
LangChain Blog·· 2026-08-26精选AI 评分60

LangChain 发布幻灯片多模态 RAG 模板与公开基准

Multi-modal RAG on slide decks

AI 导读

LangChain 发布面向演示文稿的多模态 RAG 模板,并公开基于 Datadog 财报幻灯片的 10 题评测基准。评测显示多模态嵌入方案准确率 60%、图像摘要多向量检索方案 90%,均高于纯文本 RAG 的 20%,但图像摘要需额外预生成摘要、复杂度与成本更高。模板基于 Chroma 与 OpenCLIP 多模态嵌入,上传演示文稿后按 README 两条命令即可构建向量库并运行交互式问答。

推荐理由

LangChain 公开了幻灯片多模态 RAG 的评测基准与模板,读者可据此比较两种检索方案的成本与效果取舍。

正文 · AI 翻译

关键链接

  • LangChain 公开基准评估 notebooks
  • LangChain template for multi-modal RAG on presentations

动机

检索增强生成(RAG)是 LLM 应用开发中最重要的概念之一。多种类型的文档可以被传入 LLM 的上下文窗口,从而实现交互式聊天或问答助手。虽然迄今为止许多 RAG 应用都聚焦于文本,但大量信息是以视觉内容的形式传达的。例如,幻灯片演示文稿在从投资者演示到公司内部沟通等各种用例中都很常见。随着像 GPT-4V 这样的多模态 LLM 的出现,现在已有可能解锁对幻灯片演示文稿中经常捕获的视觉内容的 RAG。下面,我们展示两种解决此问题的方法。我们分享一个用于评估幻灯片演示文稿上 RAG 的公开基准,并用它来突出这些方法之间的权衡。最后,我们提供一个模板,用于快速为幻灯片演示文稿创建多模态 RAG 应用。

设计

该任务类似于文本文档上的 RAG 应用:根据用户问题检索相关幻灯片,并将其传递给多模态 LLM(GPT-4V)以进行答案合成。 至少有兩種通用方法可以解决这个问题。

(1) 多模态嵌入:将幻灯片提取为图像,使用多模态嵌入对每个图像进行嵌入,根据用户输入检索相关的幻灯片图像,并将这些图像传递给 GPT-4V 以进行答案合成。我们之前已经发布了一个使用 Chroma 和 OpenCLIP embeddings 的cookbook。

(2) 多向量检索器:将幻灯片提取为图像,使用 GPT-4V 对每个图像进行摘要,将图像摘要与原始图像的链接一起嵌入,根据图像摘要与用户输入之间的相似性检索相关图像,最后将这些图像传递给 GPT-4V 以进行答案合成。我们之前已经发布了一个使用多向量检索器的cookbook。

这些方法之间的权衡很直接:多模态嵌入是一种更简单的设计,类似于我们对基于文本的 RAG 应用所做的,但选项有限,并且对于检索视觉上相似的图表或表格的能力存在一些疑问。相比之下,图像摘要使用成熟的文本嵌入模型,并且可以相当详细地描述图表或图形。但这种设计存在更高的复杂性和图像摘要成本。 

评估

为了评估这些方法,我们选择了 Datadog 最近的一份收益演示文稿作为具有视觉和定性元素混合的现实幻灯片演示文稿。我们为这个幻灯片演示文稿创建了一个小型公开的LangChain 基准,包含 10 个问题:您可以在此处和此处查看在此基准上进行评估的文档。

作为健全性检查,我们可以看到基于幻灯片内容的自然语言描述来检索幻灯片是可能的(下面,请参阅代码此处)。

我们基准中的问答对基于幻灯片的视觉内容。我们使用 LangSmith 评估了上述两种 RAG 方法,并与使用文本提取的 RAG 进行了比较(Top K RAG (text only))。

方法

得分(CoT 准确率)

Top k RAG(仅文本)

20%

多模态嵌入

60%

带图像摘要的多向量检索器

90%

LangSmith 提供了一个对比视图,我们可以并排查看每个实验的结果。 这里是一个公开页面,可以详细比较评估运行结果。下图展示了运行对比视图。

利用上述对比分析,我们可以比较每个问题的检索内容。这些幻灯片深入探讨了评估集中的每个问题-答案对以及相关的 LangSmith 追踪记录。

洞察

  1. 多模态方法远超仅文本 RAG 的性能。我们看到多模态方法(60% 和 90%)相比仅加载文本的 RAG(20%)有显著提升,考虑到保留视觉上下文对于推理幻灯片内容的重要性,这一结果是意料之中的。
  2. GPT-4V 在从图像中提取结构化数据方面非常强大。例如,参见这个追踪记录。问题要求统计客户数量,而这一信息只能从包含大量混合视觉内容的幻灯片中获取。GPT-4V 能够正确地从幻灯片中提取这一信息。
  1. 检索到正确的图像是核心挑战。正如幻灯片中所述并在上文提到的,如果检索到了正确的图像,那么 GPT-4V 通常能够正确回答问题。然而,图像检索才是核心挑战。我们发现图像摘要确实比多模态嵌入显著改善了检索效果,但代价是预计算摘要的复杂度和成本更高。核心需求是能够区分视觉上相似的幻灯片的多模态嵌入。OpenCLIP 有多种不同的模型值得尝试。

部署

为了便于针对此用例测试多模态 RAG 应用,我们发布了一个模板,它同时使用了 Chroma 和 OpenCLIP 多模态嵌入。这使得入门变得极其简单:只需上传一份演示文稿并按照 README 操作(仅需两条命令即可构建向量存储并运行 playground)。下面我们可以看到Datadog 财报演示文稿上的交互式聊天 playground(左侧),以及显示检索到正确幻灯片的 LangSmith 追踪记录(右侧)。

结论

多模态 LLM 有潜力为 RAG 应用解锁幻灯片中的视觉内容。我们基于 Datadog 的投资者演示幻灯片构建了一个公开的问答对基准评估集(此处)。我们在此基准上测试了两种多模态 RAG 方法。我们发现两者都超过了仅文本 RAG 的性能。我们确定了多模态 RAG 不同方法之间的权衡:对每张幻灯片进行文本摘要可以改善检索,但代价是需要预生成每张幻灯片的摘要。多模态模型可能具有更高的性能上限,但目前可选方案有些有限,并且在我们的测试中表现不如文本摘要。为了帮助多模态 RAG 应用的测试和部署,我们还发布了一个模板。

来源:LangChain Blog · langchain.com