跳到正文
  1. Hugging Face Blog60

    Sentence Transformers v6.0 新增 MultiVectorEncoder 支持晚交互检索

    Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,PyLate 与 Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也能通过同一套 API 使用。

    推荐理由:Sentence Transformers v6.0 新增多向量编码器,读者可据此判断晚交互检索的接入方式与索引成本。

  1. Hugging Face Blog62

    Sentence Transformers v5.4 支持多模态嵌入与重排模型

    Sentence Transformers 发布 v5.4,可在同一套 API 中编码和比较文本、图像、音频与视频,并支持多模态重排模型。新增能力覆盖跨模态相似度、encode_query/encode_document 检索流程以及先检索后重排的 RAG 模式,官方同时列出了 Qwen3-VL、NVIDIA Nemotron、BGE-VL 等已支持模型。

    推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此判断跨模态检索的落地路径。

  1. Hugging Face Blog62

    如何在一天内构建领域专用嵌入模型

    NVIDIA 发布一套基于 NeMo 的嵌入模型微调流程,用单张 GPU 和不到一天时间把通用嵌入模型改造成领域专用模型,无需人工标注。流程包含用 LLM 从领域文档生成合成问答对、挖掘难负样本、多跳问题展开、对比学习微调、BEIR 评测以及导出为 ONNX/TensorRT 并用 NVIDIA NIM 部署六步。

    推荐理由:原文给出从文档到部署的六步嵌入模型微调流程与实测指标,可迁移到自有领域语料。

  1. Hugging Face Blog64

    Hugging Face 详解嵌入向量二值与标量量化:检索更快更省

    Hugging Face 博客介绍嵌入向量的二值量化与标量(int8)量化,用于降低检索的内存、磁盘占用和成本。二值量化把 float32 值转为 1 bit,内存与存储减少 32 倍,配合 rescoring 可保留约 96% 的检索性能;int8 量化减少 4 倍,性能保留约 99.3%。

    推荐理由:原文给出二值与标量量化的实测数据与代码示例,读者可据此评估检索成本与性能的取舍。

已经到底了