Banque des Territoires x Polyconseil x Hugging Face:用主权数据方案升级法国校园环保项目 EduRénov
Banque des Territoires(CDC 集团)、Polyconseil 与 Hugging Face 合作开发了一套基于 RAG 的主权数据方案,用于支持 EduRénov 校园生态改造项目,首阶段已完成。
Banque des Territoires(CDC 集团)、Polyconseil 与 Hugging Face 合作开发了一套基于 RAG 的主权数据方案,用于支持 EduRénov 校园生态改造项目,首阶段已完成。
Hugging Face Embedding Container for Amazon SageMaker 正式可用(GA),AWS 客户可借此在 SageMaker 上部署嵌入向量模型,构建 RAG 等生成式 AI 应用。
Hugging Face 与 LangChain 联合推出合作包 langchain_huggingface,这是一个由双方共同维护的 Python 包,旨在将 Hugging Face 最新能力更快带入 LangChain 生态。
Intel 在 OPEA 开放平台上展示了用 Gaudi 2 AI 加速器和 Xeon CPU 构建企业级 RAG 应用的方案,LLM 跑在 Gaudi 2 上、嵌入模型跑在 Granite Rapids CPU 上。
MotherDuck 与 Numbers Station 推出 DuckDB-NSQL-7B,一个专为 DuckDB SQL 设计的大语言模型,基于 Meta Llama-2-7b 微调并进一步用 DuckDB text-to-SQL 数据对精调,可生成包括官方文档和扩展在内的多种有效 DuckDB SQL 语句。
Hugging Face 博客介绍嵌入向量的二值量化与标量(int8)量化,用于降低检索的内存、磁盘占用和成本。二值量化把 float32 值转为 1 bit,内存与存储减少 32 倍,配合 rescoring 可保留约 96% 的检索性能;int8 量化减少 4 倍,性能保留约 99.3%。
推荐理由:原文给出二值与标量量化的实测数据与代码示例,读者可据此评估检索成本与性能的取舍。
Hugging Face 发布教程,展示如何借助 Optimum Intel 与 IPEX 在英特尔 Xeon CPU 上加速 BGE 嵌入模型,并集成进 fastRAG 的 RAG 流程。优化聚焦 45M、110M、355M 参数的 BGE small、base、large 三款模型,通过 int8 量化、bf16 及 AMX 加速降低单条查询延迟并提升吞吐。
Hugging Face 发布 Matryoshka 嵌入模型入门博客,介绍这类模型可输出多种维度的有效嵌入,将重要信息前置以便截断后仍保持性能。
Hugging Face 发布教程,介绍如何通过 Text Embeddings Inference(TEI)将开源嵌入模型部署到 Hugging Face Inference Endpoints。
Hugging Face 发布 Embeddings 入门教程,演示如何用开源库 Sentence Transformers 和 Inference API 构建 FAQ 语义搜索。教程选用 sentence-transformers/all-MiniLM-L6-v2 模型,将美国 Medicare FAQ 数据集嵌入后上传至 Hub 免费托管,再通过比对用户查询与嵌入向量的相似度匹配最相关问答。
Hugging Face Transformers 的 RAG 模型集成 Ray 实现分布式文档检索,每次检索调用相比 torch.distributed 提速 2 倍,并改善了 RAG 分布式微调的可扩展性。