用 Intel Sapphire Rapids 加速 PyTorch Transformers(上篇)
Hugging Face 展示了如何在 AWS 的 Intel Sapphire Rapids(第四代 Xeon)CPU 集群上加速 PyTorch Transformer 训练,借助 Intel CCL 做分布式、IPEX 自动启用 AMX 指令,无需改动一行代码。
Hugging Face 展示了如何在 AWS 的 Intel Sapphire Rapids(第四代 Xeon)CPU 集群上加速 PyTorch Transformer 训练,借助 Intel CCL 做分布式、IPEX 自动启用 AMX 指令,无需改动一行代码。
Hugging Face 博客推出"AI for Game Development"系列教程,演示如何在 5 天内用 AI 工具做出一个完整农场游戏。
Hugging Face 发布指南,介绍如何通过 transformers 使用零样本图像分割模型 CLIPSeg。该模型在冻结的 CLIP 之上训练 Transformer 解码器,可生成粗略分割掩码,用于机器人感知、图像修复等任务,并支持文本或图像作为提示进行视觉提示。CLIPSeg 使用 352 x 352 像素图像,输出分辨率较低,如需更精细结果可在 Segments.ai 上微调优化。
Hugging Face 推出模型卡创建工具和模型卡指南,前者提供图形界面,无需编程或 Markdown 即可协作编写模型卡。同时发布更新版模型卡模板(集成于 huggingface_hub 库)和带注释模板,并附上用户研究与文献综述。
Hugging Face 伦理与社会团队发布第二期通讯,讨论机器学习中的偏见问题,指出偏见普遍且复杂,单一技术手段难以有效解决。文章强调 ML 模型作为社会技术系统会放大社会趋势,需结合部署场景持续监测,并介绍了团队开发的偏见分析工具,覆盖任务定义、数据集整理和模型训练各阶段。
Hugging Face 发布音频数据集使用指南,介绍如何通过 🤗 Datasets 的 load_dataset 函数一行代码下载并准备音频数据。目前 Hub 上已有 77 个语音识别数据集和 28 个音频分类数据集,并支持 Dataset Preview 在线试听样本。以 GigaSpeech 为例,其提供从 xs(10 小时)到 xl(10,000 小时)五种规模配置。
Habana Gaudi2 在 BERT 预训练和 Stable Diffusion 推理上约为 Nvidia A100 80GB 的两倍速度。BERT 预训练中 Gaudi2 吞吐达 1580.2 samples/s(BS=32),A100 为 981.6;Stable Diffusion 推理延迟 0.925s/img,A100 为 2.63s。
Hugging Face 发布图解 RLHF 的教程文章,把训练流程拆成预训练语言模型、收集偏好数据训练奖励模型、用 PPO 微调语言模型三个核心步骤。文章指出奖励模型输出标量奖励,训练时用 KL 散度惩罚约束策略偏离初始模型,并介绍了 TRL、TRLX、RL4LMs 等开源 RLHF 工具。文中还提到人类标注成本高、标注者意见不一致等局限,以及离线 RL、ILQL 等尚未充分探索的方向。
推荐理由:把 RLHF 拆成预训练、奖励模型、PPO 微调三步,并梳理了开源实现与已知局限,适合作为入门框架参考。
Elixir 社区推出 Bumblebee 库,用纯 Elixir 实现了 Hugging Face Transformers,将 GPT2 到 Stable Diffusion 等神经网络模型引入 Elixir。
Hugging Face 发布面向生物学家与机器学习者的蛋白质深度学习入门文章,并附上微调蛋白质语言模型(PyTorch、TensorFlow)和用 ESMFold 做蛋白质折叠(仅 PyTorch)的示例 notebook。文章从 2018 年 ULMFiT 与 BERT 讲起,说明迁移学习如何把预训练知识复用到新任务,并指出其效果常相当于 100 倍以上的训练数据。
Hugging Face 联合 Apple 工程师把 Stable Diffusion 权重转换为 Core ML 格式并上传到 Hub,可在 Apple Silicon 的 CPU、GPU 和神经引擎上运行。
推荐理由:原文给出在 Apple Silicon 上用 Core ML 跑 Stable Diffusion 的完整流程与性能参考,可迁移到本地部署实践。
Hugging Face 博客介绍如何用 🤗 Transformers 库中的 Time Series Transformer 完成单变量概率时间序列预测。该模型基于 Encoder-Decoder Transformer 架构,通过 Ancestral Sampling 自回归生成预测,并支持将缺失值作为额外 mask 参与训练而无需插补。
中国科学技术大学与微软提出 VQ-Diffusion,一种在量化隐空间上执行加噪与去噪的条件扩散模型,隐空间由离散向量集合构成。该模型使用冻结的 VQ-VAE 编码图像,并以编码器-解码器 Transformer 近似反向过程,一次前向即可预测全部未加噪隐变量的分布。
Hugging Face 宣布启动 2023 年实习生项目,开放 8 个岗位,涵盖 Accelerate、文本转语音、具身智能、大语言模型分布式训练框架、LLM 数据集、生成式模型社会影响评估和 AI 艺术工具等方向。实习生将与 Hugging Face 导师及相应开源库维护者合作,申请需通过官方招聘门户并注册 Hugging Face 账号。
Hugging Face 与 Jonathan Whitaker 合作的扩散模型课程将于 11 月 28 日发布,配套社区直播活动定于 11 月 30 日举行。
Hugging Face 发布《机器学习总监洞察》系列第四期,邀请 Javier Mansilla、Shaun Gittens、Samuel Franklin 和 Evan Castle 四位 ML 总监分享机器学习对各自行业的影响。
Hugging Face 发文梳理 Document AI 的六大用例及对应开源模型,涵盖 OCR、文档图像分类、版面分析、文档解析等任务。文档图像分类中,LayoutLMv3 和 Donut 等多模态模型在 RVL-CDIP 上可达 95% 准确率,优于 BERT-base 的 89% 和纯视觉 DiT 的 92%。
Hugging Face 梳理了其推理方案:模型页内置免费 Inference Widget,底层由免费 Inference API 驱动,可通过 HTTP 请求调用任意 Hub 模型,但因限流不建议用于生产。
Hugging Face 发布教程,演示如何用 Concrete-ML 库在完全同态加密(FHE)环境下构建情感分析模型,无需任何密码学背景。流程包括用 BERT 提取文本隐藏表示、训练 XGBoost 分类器,再将预测转为加密数据上的预测,并通过客户端/服务器协议部署到云端,最后在 Hugging Face Spaces 提供完整演示。
Hugging Face 与 arXiv 合作,将 Spaces 通过 arXivLabs 集成到论文页面,新增 Demo 标签页,可直接链接社区或作者创建的开源演示。自 2021 年 10 月上线以来,Spaces 已托管超过 12,000 个开源机器学习演示,基于 Gradio 和 Streamlit 构建。以 BERT 论文为例,其 arXiv 页面已可找到 200 多个相关演示。
Hugging Face 在 transformers 4.24.0 中加入对比搜索(Contrastive Search)解码方法,PyTorch 和 TensorFlow 均可用。
Hugging Face 宣布下线 Inference API 的付费层,该服务仍对所有人免费开放,同时推出面向企业级高速推理的新产品 Inference Endpoints。Spaces 也获得硬件升级,可选择自定硬件运行 ML demo,这些服务无需订阅,只需在账单设置中绑定信用卡。所有付费服务按月计费并生成合并发票,账单页面可管理 PRO 订阅、更新支付方式并查看近三个月用量。
Hugging Face 用 🧨 Diffusers 的 Dreambooth 训练脚本做了大量实验,分析不同超参数对微调 Stable Diffusion 的影响并给出推荐设置。
推荐理由:基于大量实验给出 Dreambooth 微调 Stable Diffusion 的超参数建议,可迁移到自己的训练流程。
Hugging Face 发布教程,介绍如何用 Transformers 在任意多语言 ASR 数据集上微调 Whisper,涵盖 Common Voice 数据准备、特征提取器与 tokenizer 配置、训练评估及 Gradio 演示的完整代码。
推荐理由:原文给出用 Transformers 微调 Whisper 的完整代码流程,并附 8 小时数据把 WER 从 63.5% 降到 32.0% 的实测结果。
Hugging Face 将 Intel OpenVINO 集成进 Optimum Intel,用户可基于 OpenVINO 2022.2 在多种 Intel 处理器上对 Transformers 模型执行推理,并用 NNCF 在数分钟内完成量化以降低模型体积和预测延迟。
Hugging Face 为 🤗 Evaluate 库新增偏见评估指标,可对 GPT-2、BLOOM 等因果语言模型进行基于提示词的偏见检测。工作流分两步:用 🤗 Datasets 上的预设提示词生成文本,再用 🤗 Evaluate 的指标打分,覆盖 Toxicity、Polarity、Hurtfulness 三类任务。
Hugging Face 发布教程,演示如何通过三个递进抽象层级实现多 GPU 分布式训练:原生 PyTorch DDP(torch.distributed)、🤗 Accelerate 轻量封装(无需改代码即可支持单 GPU 和 TPU)、以及 🤗 Transformer 的 Trainer API。
Hugging Face 发布 MTEB,一个衡量文本嵌入模型在多种嵌入任务上表现的基准,包含 8 类任务、56 个数据集,覆盖最多 112 种语言,榜单已汇总超过 2000 条结果。
推荐理由:MTEB 把 56 个数据集、8 类任务和 112 种语言汇总到同一榜单,读者可据此理解文本嵌入模型的评测维度与取舍。
Hugging Face 推出 Inference Endpoints,支持从 Hub 直接部署模型到托管基础设施,几步点击即可完成。该服务提供 Public、Protected、Private 三种访问级别,Private 模式通过 AWS PrivateLink 的 VPC Endpoint 接入,仅限指定 AWS 账户访问。
Hugging Face Diffusers 自 0.5.1 版起支持 Flax,可在 Colab、Kaggle 或 Google Cloud 的 TPU 上快速推理 Stable Diffusion。
推荐理由:Hugging Face 官方给出在 TPU 上用 JAX/Flax 跑 Stable Diffusion 的完整步骤与并行原理,可迁移到多设备推理。
Hugging Face 分享了 BLOOM(176B 参数、bf16 下 352GB)推理服务的优化过程,数周内将延迟降低 5 倍、吞吐提升 50 倍。团队先用 Megatron-Deepspeed 训练,再由 Younes 耗时近一个月、200 次 commit 移植到 transformers,并借助 accelerate 的 device_map="auto" 做流水线并行分片。
Hugging Face 宣布用户可直接在 Hub 上为模型或数据集生成 DOI,该功能与 DataCite 合作实现,注册用户填写元数据后即可获得,他人可通过模型或数据集页面的“Cite this model/dataset”按钮引用。DOI 绑定对象的 URL、版本、创建日期等元数据,提供永久链接,模型或数据集新版本发布时 DOI 可更新,旧版本 DOI 随之失效。
rinna 推出日语专用文生图模型 Japanese Stable Diffusion,通过在约 1 亿张日语标注图像上微调 Stable Diffusion 实现,可理解日语特有词汇、拟声词与专有名词。
Hugging Face 发布 Evaluation on the Hub,由 AutoTrain 驱动,无需写代码即可对 Hub 上任意因果语言模型做零样本评估,目前支持最高 660 亿参数模型,更大模型的支持即将推出。
Hugging Face AutoTrain 新增图像分类任务,用户无需编写代码即可训练模型。上传数据后,AutoTrain 自动尝试多个模型架构,示例中最佳模型达到 84% 准确率,5 个候选模型加 500 张以内图片的训练免费。
Hugging Face 撰文解释 Accelerate 如何借助 PyTorch 在内存和显存不足的消费级硬件上加载并运行超大模型。它先用 meta device 创建空模型并计算 device map,再按分片逐步加载权重,把层分配到多张 GPU、CPU 内存乃至磁盘,最后通过 hooks 在每次前向传播前后搬运权重。
推荐理由:原文拆解了 Accelerate 借助 PyTorch meta device 与分片加载在有限显存下跑大模型的完整流程,可迁移到自己的推理部署。
Hugging Face 联合 Intel Labs 和 UKP Lab 发布 SetFit,一个面向 Sentence Transformers 的高效少样本微调框架,无需提示词或 verbaliser。
推荐理由:原文给出 SetFit 的两阶段训练流程、RAFT 基准对比与 30 秒训练成本,读者可据此判断少样本分类的落地门槛。
Hugging Face 发布首期 Ethics and Society 通讯,计划按季节在春分、秋分、夏至、冬至发布,由公司内部跨部门开放小组“Ethics and Society regulars”以平等身份共同编写。该通讯围绕协作、责任与透明等原则,分享 Hugging Face 在机器学习伦理落地方面的思考与项目实践,并明确不设统一价值观清单,而是持续输出项目层面的具体讨论。
Hugging Face 发布教程,展示如何用 DeepSpeed-Inference、Accelerate 和 DeepSpeed ZeRO 为 176B 参数的 BLOOM 做推理,并给出 8x80GB A100 上的吞吐基准。
Hugging Face 发布 diffusers 0.3,为扩散模型工具箱新增图生图、文本反转、实验性修复(inpainting)等流水线,并加入面向小显存的优化,Stable Diffusion 显存占用可降至 3.2GB,代价是约 10% 的速度损失。
推荐理由:diffusers 0.3 集中补齐图生图、文本反转、修复与低显存优化,可据此判断扩散模型工具链的成熟度。