Hugging Face Hub 集成 DuckDB:用 SQL 分析 5 万多个数据集
Hugging Face Hub 新增 DuckDB 集成,用户可用 SQL 直接查询 Hub 上任意公开数据集。数据集查看器会自动将所有公开数据集转换为 Parquet 文件,通过 /parquet 端点获取 URL 后,配合 DuckDB 的 httpfs 扩展即可查询远程文件,并支持分片后的多个 Parquet 文件。
Hugging Face Hub 新增 DuckDB 集成,用户可用 SQL 直接查询 Hub 上任意公开数据集。数据集查看器会自动将所有公开数据集转换为 Parquet 文件,通过 /parquet 端点获取 URL 后,配合 DuckDB 的 httpfs 扩展即可查询远程文件,并支持分片后的多个 Parquet 文件。
Hugging Face 现已托管 Meta AI 开源的 fastText 官方镜像,涵盖 157 种语言的词向量和最新语言识别模型。用户可通过 huggingface_hub 库的 hf_hub_download 命令直接下载使用,并支持文本分类与特征提取 widget。
阿布扎比 TII 发布 Apache 2.0 许可的 Falcon 语言模型家族,包含 Falcon-40B 和 Falcon-7B 两个基础模型及对应 Instruct 版本。
推荐理由:梳理 Falcon 系列在 Hugging Face 生态中的推理、量化与微调路径,可了解开源大模型的落地方式。
Hugging Face 发布教程,讲解如何借助 Hugging Face Unity API 在 Unity 游戏中实现语音识别,可用于下达指令、与 NPC 对话或提升无障碍体验。教程从创建含开始/停止按钮和 TextMeshPro 文本框的场景入手,用 Microphone.Start() 以 44100 Hz 录制最长 10 秒音频,再编码为 WAV 格式发送给 API 转成文本。
Hugging Face 宣布举办首届 Open Source AI Game Jam,活动时间为 7 月 7 日至 9 日,参与者需在周末内用 AI 工具制作一款游戏。
Hugging Face Hub 现已集成 BERTopic,用户可直接在 Hub 上分享和加载主题模型。BERTopic 是一种基于 Transformer 嵌入向量与 c-TF-IDF 的主题建模技术,此次集成让主题模型也能像其他模型一样被托管和复用。
Hugging Face 发布面向 Amazon SageMaker 的 LLM Inference DLC,基于 Text Generation Inference(TGI),可部署 BLOOM、StarCoder、Llama、T5 等开源大模型。
Hugging Face 联合 OpenVINO 的 NNCF 框架,通过量化感知训练(QAT)结合 Token Merging 优化 Stable Diffusion 的 UNet 模型,在 Intel CPU 上实现相比 PyTorch 5.1 倍推理加速和 4 倍模型体积缩减。
Hugging Face 与 bitsandbytes 合作,在 transformers 中支持以 4-bit 精度加载和运行模型,覆盖文本、视觉、多模态等大部分 HF 模型,并可在 4bit 模型上训练 LoRA 适配器。
推荐理由:Hugging Face 把 4-bit 量化与 QLoRA 微调接入 transformers,读者可据此判断消费级显卡能跑多大模型。
Hugging Face 与微软合作,在 Azure Machine Learning Studio 内推出 Hugging Face Hub 模型目录,收录数千个热门 Transformers 模型,用户可在托管端点上一键部署。该目录已在所有提供 Azure Machine Learning 的 Azure 区域开放公开预览。
Hugging Face 联合 EleutherAI 和 Stability AI 委托 Trail of Bits 对 safetensors 库进行外部安全审计,未发现可导致任意代码执行的关键安全漏洞,并已修复规范格式不精确和允许 polyglot 文件的验证缺失问题。
推荐理由:Hugging Face 联合 EleutherAI、Stability AI 公开 safetensors 外部安全审计结果,读者可了解该格式为何被推向默认。
Hugging Face 博客介绍如何将 InstructPix2Pix 的训练策略与 FLAN 的指令模板思路结合,对 Stable Diffusion 做指令微调,使其按输入图像加指令完成卡通化、去雨等图像翻译与底层图像处理任务。
Hugging Face 宣布与 IBM 合作,将其开源库集成到 IBM 的新一代企业 AI 工作室 watsonx.ai 中。watsonx.ai 基于 RedHat OpenShift 构建,支持云端和本地部署,并集成了 transformers、accelerate、peft 和 Text Generation Inference 等 Hugging Face 库。
Hugging Face 博客详解 BigCode 项目采用 MinHash + LSH 进行大规模文档级近重复去重的方法,参数为 (256, 0.7, 5)。该方案已在 The Stack 代码数据集上验证,去重能提升代码模型性能并减少训练步数。文章还对比了 InCoder、CodeGen、AlphaCode 等模型所用的精确匹配与 MinHash 去重策略。
Intel 用 SmoothQuant-O3 对 OPT 2.7B/6.7B、LLaMA 7B、Alpaca 7B、Vicuna 7B、BloomZ 7.1B、MPT-7B-chat 等模型做 8-bit 量化,模型体积缩小约 2 倍,多数评测指标不降反升。
Hugging Face 被法国数据保护机构 CNIL 选入其强化支持计划,该计划从 40 多个候选企业中选出三家“具有强劲经济发展潜力”的公司,为其理解和履行数据保护义务提供支持。Hugging Face 此前在 BigScience 和与 ServiceNow 合作的 BigCode 项目中已投入隐私风险治理与假名化工具开发,此次合作将推动 GDPR 合规并为用户厘清隐私与数据保护问题。
Hugging Face 发布教程,介绍如何在单张 AMD GPU 上通过 ROCm 运行 13B 参数的 Vicuna 聊天机器人。Vicuna 由 UC Berkeley、CMU、斯坦福和 UCSD 团队基于 LLaMA 微调,使用约 70K 条 ShareGPT 对话数据,训练成本约 300 美元,据 GPT-4 评估质量达 ChatGPT 的 90% 以上。
Hugging Face 官方博客宣布,结合 RNN 与 Transformer 优势的 RWKV 架构已集成进 transformers 库,可通过源码或主分支使用。
推荐理由:Hugging Face 官方博客介绍 RWKV 架构并入 transformers 库,读者可了解其兼顾 RNN 推理效率与 Transformer 训练并行的设计思路。
Hugging Face 发布辅助生成(assisted generation)解码方法,通过小模型生成候选 token、大模型一次前向验证,在消费级硬件上最多降低 10 倍延迟。
推荐理由:Hugging Face 官方详解辅助生成解码原理与 Transformers 用法,读者可据此判断低延迟文本生成的可行路径。
Hugging Face 团队介绍如何将 16B 参数的 StarCoder 微调为对话式编码助手 StarChat,使用 OpenAssistant 约 2.1 万条英文对话数据,并采用 ChatML 格式标记角色、屏蔽用户轮次的损失。
推荐理由:原文完整给出用对话数据微调 StarCoder 的流程与代码,读者可据此复现一个开源编码助手。
Hugging Face 发文梳理文本到视频模型的发展脉络,指出该任务比文本到图像更难,需保证帧间时空一致性,面临算力成本高、高质量数据集稀缺、视频描述模糊三大挑战。
BigCode 发布 StarCoder 与 StarCoderBase 两个代码大模型,基于 GitHub 宽松许可数据训练,覆盖 80 多种编程语言,参数规模约 15B、训练 1 万亿 token。
推荐理由:BigCode 公开了 StarCoder 的权重、训练数据与评测结果,读者可据此判断开源代码模型当时的能力水位。
Hugging Face Unity API 可将 Hugging Face Inference API 集成进 Unity 项目,开发者通过 Package Manager 添加 git URL 安装,并在 API Wizard 中填入 API key 即可调用模型。
Hugging Face 发布教程,演示如何用 🤗 Transformers 结合 TensorFlow 和 TPU 从零训练一个 RoBERTa base 模型,涵盖训练 tokenizer、在 WikiText v1 上分词并转为 TFRecord 存入 Google Cloud Storage,再到模型训练与上传的完整流程。
Hugging Face 博客介绍如何在免费版 Google Colab(13GB CPU 内存、15GB T4 显存)上用 diffusers 运行 DeepFloyd 的 IF 文生图模型。
推荐理由:原文给出在免费 Colab 上分阶段加载 IF 的完整代码与显存取舍,可迁移到其他大模型的低显存部署。
Databricks 宣布向 Hugging Face 代码库提交首个官方贡献,新增 Datasets 的 from_spark 函数,可直接将 Apache Spark dataframe 转为 Hugging Face Dataset。
Hugging Face 上线中文博客 hf.co/blog/zh,由志愿者翻译 transformers、diffusion 和强化学习等博客与课程内容。官方同时提到 HuggingGPT、ChatGLM、RWKV、ChatYuan、ModelScope 文生视频模型及 IDEA CCNL、BAAI 等中国社区成果,并已与 PaddlePaddle 等合作推进集成。
Hugging Face 发布教程,介绍如何将 Unity 游戏托管到 Hugging Face Space。步骤包括用 Static HTML 模板创建 Space、将 Unity 项目构建目标切换为 WebGL、把 Compression Format 设为 Disabled,并用 Git-LFS 推送构建文件。完成后即可在 Space 中直接游玩自己的 Unity 游戏。
Hugging Face 与 AWS 合作,将 Hugging Face Transformers 针对 AWS Inferentia2 推理加速器进行优化,通过 optimum-neuron 只需一行代码即可编译模型。
Hugging Face 发布教程,演示如何用 Transformers 库(需 >= 4.27.2)进行图分类,目前该库中唯一的图 Transformer 模型是微软的 Graphormer。教程以 Stanford OGB 的 ogbg-molhiv 数据集为例,介绍数据加载、Graphormer 默认预处理及加载预训练 checkpoint 微调的二分类流程。
Hugging Face 与开源联邦学习框架 Substra 合作创建了一个演示空间,展示如何在数据不出本地的前提下训练模型。联邦学习只传输模型权重而非原始数据,用多来源数据训练的模型在验证集上几乎总是优于单一来源模型。Substra 已在乳腺癌研究和 MELLODDY 项目中得到实际验证。
Snorkel AI 与 Hugging Face 达成合作,将 Hugging Face 的 Inference Endpoint 服务集成进 Snorkel Flow 平台,让企业用户可直接调用其超过 150,000 个开源模型来适配自身用例。
Hugging Face 发布 StackLLaMA 模型及完整 RLHF 训练流程,用 LLaMA 7B 在 Stack Exchange 问答数据上依次完成监督微调、奖励建模和 PPO 强化学习,训练管线已集成到 TRL 库。
推荐理由:Hugging Face 公开了用 RLHF 训练 LLaMA 的完整流程与代码,读者可据此复现或迁移到自己的模型对齐任务。
Hugging Face 发布《伦理与社会通讯 #3》,阐述其在开放 ML 中兼顾伦理的做法。平台推出 6 个伦理标签(严谨、知情同意、社会意识、可持续、包容、探究)帮助用户发现伦理相关项目,并上线举报功能,让社区标记违反内容准则的模型、数据集或 Space。此外还通过模型卡记录社会影响与偏见、推广 Open RAIL 许可证、监控讨论区等方式降低开放发布带来的风险。
Hugging Face 用 Optimum Habana 在 Habana Gaudi2 上部署 176B 参数的 BLOOMZ,16-bit 精度下 8 卡推理延迟 3.103 秒,比 A100 80GB 的 4.402 秒快 1.42 倍。
Hugging Face 展示了在 Intel Sapphire Rapids CPU 上加速 Stable Diffusion 推理的多种技术。
Hugging Face 发布教程,演示如何用 Flower 框架在多个客户端上联邦微调预训练 Transformer 模型 distilBERT,用于 IMDB 影评情感分类。教程使用 datasets、evaluate、flwr、torch 和 transformers 等库,并提供了在 Google Colab 中通过 Flower 模拟功能复现联邦设置的 notebook。
Hugging Face 发布教程,讲解如何用 diffusers 训练 ControlNet,并以人脸姿态为例走完条件设计、数据集构建和模型训练三步。数据集基于微软 FaceSynthetics 的 100K 合成人脸,用 SPIGA 提取 iBUG 68 点关键点生成条件图,再用 BLIP 生成 caption。
推荐理由:Hugging Face 官方复盘了从条件设计、数据集构建到 diffusers 训练脚本的完整 ControlNet 训练流程,并给出不同显存下的参数配置。
Hugging Face Hub 新增 Jupyter notebook 渲染支持,托管在 Hub 上的 ipynb 文件将以人类可读格式显示,不再直接呈现原始 JSON。Hub 目前已托管超 7,000 个 notebook,并支持一键在 Google Colab 中打开。
Hugging Face 在 🤗 Transformers 中上线了 AAAI21 最佳论文模型 Informer,并演示如何用它完成多变量概率时间序列预测。