如何微调 MMS Adapter 模型实现低资源 ASR
Hugging Face 发布教程,介绍如何基于 Meta AI 的 MMS 检查点微调 Adapter 层实现低资源语音识别。MMS 预训练检查点覆盖 1400 多种语言、参数量 300M 到 1B,每个 Adapter 层仅约 2.5M 权重,微调 10-20 分钟即可获得极低词错误率。低资源语言推荐用 Adapter 训练替代全模型微调,更省内存且性能更好。
Hugging Face 发布教程,介绍如何基于 Meta AI 的 MMS 检查点微调 Adapter 层实现低资源语音识别。MMS 预训练检查点覆盖 1400 多种语言、参数量 300M 到 1B,每个 Adapter 层仅约 2.5M 权重,微调 10-20 分钟即可获得极低词错误率。低资源语言推荐用 Adapter 训练替代全模型微调,更省内存且性能更好。
Hugging Face 通过扩展 Open LLM Leaderboard 评估套件,对比了 GPT-4 自动评估与 Scale AI 人类标注在开源指令模型上的偏好排序。
Hugging Face Hub 面向美术馆、图书馆、档案馆与博物馆(GLAM)从业者,介绍如何查找模型并上传馆藏数据集。Hub 目前托管超 190,000 个模型、33,000 个数据集和超 100,000 个应用与 demo,覆盖文本、图像、音频等任务。文中以挪威文献的命名实体识别(NER)模型为例,并演示通过浏览器界面将 CSV 数据集上传为数据集仓库。
Hugging Face Hub 新增 DuckDB 集成,用户可用 SQL 直接查询 Hub 上任意公开数据集。数据集查看器会自动将所有公开数据集转换为 Parquet 文件,通过 /parquet 端点获取 URL 后,配合 DuckDB 的 httpfs 扩展即可查询远程文件,并支持分片后的多个 Parquet 文件。
Hugging Face 现已托管 Meta AI 开源的 fastText 官方镜像,涵盖 157 种语言的词向量和最新语言识别模型。用户可通过 huggingface_hub 库的 hf_hub_download 命令直接下载使用,并支持文本分类与特征提取 widget。
阿布扎比 TII 发布 Apache 2.0 许可的 Falcon 语言模型家族,包含 Falcon-40B 和 Falcon-7B 两个基础模型及对应 Instruct 版本。
推荐理由:梳理 Falcon 系列在 Hugging Face 生态中的推理、量化与微调路径,可了解开源大模型的落地方式。
Hugging Face 博客详解 BigCode 项目采用 MinHash + LSH 进行大规模文档级近重复去重的方法,参数为 (256, 0.7, 5)。该方案已在 The Stack 代码数据集上验证,去重能提升代码模型性能并减少训练步数。文章还对比了 InCoder、CodeGen、AlphaCode 等模型所用的精确匹配与 MinHash 去重策略。
OpenAI 用 GPT-4 自动为大型语言模型中的神经元行为撰写解释,并对这些解释打分。团队公开了 GPT-2 中每个神经元的解释与评分数据集,并说明这些解释并不完美。
推荐理由:OpenAI 用 GPT-4 自动为神经元行为写解释并打分,并公开 GPT-2 全部神经元的解释与评分数据集。
Hugging Face 团队介绍如何将 16B 参数的 StarCoder 微调为对话式编码助手 StarChat,使用 OpenAssistant 约 2.1 万条英文对话数据,并采用 ChatML 格式标记角色、屏蔽用户轮次的损失。
推荐理由:原文完整给出用对话数据微调 StarCoder 的流程与代码,读者可据此复现一个开源编码助手。
BigCode 发布 StarCoder 与 StarCoderBase 两个代码大模型,基于 GitHub 宽松许可数据训练,覆盖 80 多种编程语言,参数规模约 15B、训练 1 万亿 token。
推荐理由:BigCode 公开了 StarCoder 的权重、训练数据与评测结果,读者可据此判断开源代码模型当时的能力水位。
Hugging Face 发布教程,演示如何用 🤗 Transformers 结合 TensorFlow 和 TPU 从零训练一个 RoBERTa base 模型,涵盖训练 tokenizer、在 WikiText v1 上分词并转为 TFRecord 存入 Google Cloud Storage,再到模型训练与上传的完整流程。
Databricks 宣布向 Hugging Face 代码库提交首个官方贡献,新增 Datasets 的 from_spark 函数,可直接将 Apache Spark dataframe 转为 Hugging Face Dataset。
Hugging Face 发布教程,演示如何用 Transformers 库(需 >= 4.27.2)进行图分类,目前该库中唯一的图 Transformer 模型是微软的 Graphormer。教程以 Stanford OGB 的 ogbg-molhiv 数据集为例,介绍数据加载、Graphormer 默认预处理及加载预训练 checkpoint 微调的二分类流程。
Hugging Face 与开源联邦学习框架 Substra 合作创建了一个演示空间,展示如何在数据不出本地的前提下训练模型。联邦学习只传输模型权重而非原始数据,用多来源数据训练的模型在验证集上几乎总是优于单一来源模型。Substra 已在乳腺癌研究和 MELLODDY 项目中得到实际验证。
Hugging Face 发布 StackLLaMA 模型及完整 RLHF 训练流程,用 LLaMA 7B 在 Stack Exchange 问答数据上依次完成监督微调、奖励建模和 PPO 强化学习,训练管线已集成到 TRL 库。
推荐理由:Hugging Face 公开了用 RLHF 训练 LLaMA 的完整流程与代码,读者可据此复现或迁移到自己的模型对齐任务。
Hugging Face 发布教程,演示如何用 Flower 框架在多个客户端上联邦微调预训练 Transformer 模型 distilBERT,用于 IMDB 影评情感分类。教程使用 datasets、evaluate、flwr、torch 和 transformers 等库,并提供了在 Google Colab 中通过 Flower 模拟功能复现联邦设置的 notebook。
Hugging Face 发布教程,讲解如何用 diffusers 训练 ControlNet,并以人脸姿态为例走完条件设计、数据集构建和模型训练三步。数据集基于微软 FaceSynthetics 的 100K 合成人脸,用 SPIGA 提取 iBUG 68 点关键点生成条件图,再用 BLIP 生成 caption。
推荐理由:Hugging Face 官方复盘了从条件设计、数据集构建到 diffusers 训练脚本的完整 ControlNet 训练流程,并给出不同显存下的参数配置。
OpenAI 发布题为 GPTs are GPTs 的研究,初步考察大语言模型对劳动力市场的潜在影响。原文正文未能抓取,仅标题可用。
Hugging Face 在 🤗 Transformers 中上线了 AAAI21 最佳论文模型 Informer,并演示如何用它完成多变量概率时间序列预测。
Hugging Face 官方发布 trl 与 peft 的集成,让大语言模型的 RLHF 微调成本大幅降低。方案先用 LLM.int8() 以 8 位精度加载模型,再用 peft 添加低秩适配器只训练少量参数,并借助 disable_adapters 复用同一模型获取参考模型与当前模型的 logits,从而省去第二份模型副本。
推荐理由:trl 与 peft 的集成给出了在 24GB 消费级 GPU 上做 RLHF 微调的具体路径,可迁移到自有训练流程。
Kakao Brain 与 Hugging Face 联合发布开源图文数据集 COYO(7 亿图文对)以及基于该数据集训练的 ViT 和 ALIGN 视觉语言模型,这是 ALIGN 模型首次免费开源,也是 ViT 和 ALIGN 首次附带训练数据集发布。
推荐理由:Kakao Brain 开源了首个可复现的 ALIGN 模型及配套 7 亿图文对数据集,读者可据此了解开放数据对视觉语言模型复现的意义。
2023 年 2 月 6 日土耳其东南部发生 7.7 和 7.6 级地震后,一群程序员在 Discord 上协作开发了名为 afetharita(灾害地图)的应用,用于从幸存者的推文和截图中提取地址与需求信息,供搜救队和志愿者使用。
推荐理由:作者以志愿者身份复盘土耳其地震救援中的模型选型与部署流程,可迁移到快速搭建应急类 ML 应用。
Hugging Face 专家加速计划帮助 Witty Works 将其包容性写作助手的非包容性词汇分类器从 vanilla transformers 转向 Sentence Transformers 架构,并结合 SetFit 库实现少样本微调,每个词仅需 15-20 条标注句子。
红队测试通过构造自然语言提示词诱导大语言模型暴露有害输出,与对抗攻击不同,其提示词对人类可读。GPT3 早期版本曾表现出性别歧视与针对穆斯林的偏见,微软 Tay 和 Bing 的 Sydney 是缺乏红队评估导致灾难性后果的真实案例。
Hugging Face 发布 PEFT 库,提供 LoRA、Prefix Tuning、Prompt Tuning、P-Tuning 等参数高效微调方法,并与 Transformers 和 Accelerate 集成。
推荐理由:原文给出 PEFT 库支持的方法与消费级硬件上的微调示例,读者可据此判断低成本微调的可行路径。
Hugging Face 博客"AI for Game Development"系列第 5 篇展示了用 ChatGPT 为农场游戏生成剧情:先让模型写故事梗概,结果与《星露谷物语》高度雷同,经多轮要求"更有原创性"并去除魔法元素后才可用。作者指出语言模型易复现已有故事、长文本易重复,直接使用 AI 输出可能带来法律、伦理与商业风险,建议仅用于头脑风暴,最终内容手写。
Hugging Face 博客梳理了让对话智能体变得有用的关键技术,包括指令微调(IFT)、监督微调(SFT)、思维链(CoT)和基于人类反馈的强化学习(RLHF)。
推荐理由:梳理 IFT、SFT、CoT 与 RLHF 在对话智能体中的作用,并对比多家早期聊天机器人的训练与评测差异。
Hugging Face 发布图机器学习入门博客,梳理图的基本概念、表示方式与任务类型,涵盖图生成、节点/边属性预测、缺失边预测和社区检测等。文章从非神经方法讲到图神经网络(GNN),并进一步介绍用于图的 Transformer。
Hugging Face 展示了如何在 AWS 的 Intel Sapphire Rapids(第四代 Xeon)CPU 集群上加速 PyTorch Transformer 训练,借助 Intel CCL 做分布式、IPEX 自动启用 AMX 指令,无需改动一行代码。
Hugging Face 伦理与社会团队发布第二期通讯,讨论机器学习中的偏见问题,指出偏见普遍且复杂,单一技术手段难以有效解决。文章强调 ML 模型作为社会技术系统会放大社会趋势,需结合部署场景持续监测,并介绍了团队开发的偏见分析工具,覆盖任务定义、数据集整理和模型训练各阶段。
Hugging Face 发布音频数据集使用指南,介绍如何通过 🤗 Datasets 的 load_dataset 函数一行代码下载并准备音频数据。目前 Hub 上已有 77 个语音识别数据集和 28 个音频分类数据集,并支持 Dataset Preview 在线试听样本。以 GigaSpeech 为例,其提供从 xs(10 小时)到 xl(10,000 小时)五种规模配置。
Hugging Face 发布图解 RLHF 的教程文章,把训练流程拆成预训练语言模型、收集偏好数据训练奖励模型、用 PPO 微调语言模型三个核心步骤。文章指出奖励模型输出标量奖励,训练时用 KL 散度惩罚约束策略偏离初始模型,并介绍了 TRL、TRLX、RL4LMs 等开源 RLHF 工具。文中还提到人类标注成本高、标注者意见不一致等局限,以及离线 RL、ILQL 等尚未充分探索的方向。
推荐理由:把 RLHF 拆成预训练、奖励模型、PPO 微调三步,并梳理了开源实现与已知局限,适合作为入门框架参考。
Hugging Face 发布面向生物学家与机器学习者的蛋白质深度学习入门文章,并附上微调蛋白质语言模型(PyTorch、TensorFlow)和用 ESMFold 做蛋白质折叠(仅 PyTorch)的示例 notebook。文章从 2018 年 ULMFiT 与 BERT 讲起,说明迁移学习如何把预训练知识复用到新任务,并指出其效果常相当于 100 倍以上的训练数据。
Hugging Face 博客介绍如何用 🤗 Transformers 库中的 Time Series Transformer 完成单变量概率时间序列预测。该模型基于 Encoder-Decoder Transformer 架构,通过 Ancestral Sampling 自回归生成预测,并支持将缺失值作为额外 mask 参与训练而无需插补。
Hugging Face 发布 MTEB,一个衡量文本嵌入模型在多种嵌入任务上表现的基准,包含 8 类任务、56 个数据集,覆盖最多 112 种语言,榜单已汇总超过 2000 条结果。
推荐理由:MTEB 把 56 个数据集、8 类任务和 112 种语言汇总到同一榜单,读者可据此理解文本嵌入模型的评测维度与取舍。
Hugging Face 联合 Intel Labs 和 UKP Lab 发布 SetFit,一个面向 Sentence Transformers 的高效少样本微调框架,无需提示词或 verbaliser。
推荐理由:原文给出 SetFit 的两阶段训练流程、RAFT 基准对比与 30 秒训练成本,读者可据此判断少样本分类的落地门槛。
Hugging Face 发布教程,演示如何用 transformers 库的 Trainer 和自定义 Data Collator,从零训练一个离线 Decision Transformer,让 HalfCheetah 机器人学会奔跑。
Hugging Face 发布教程,讲解如何在 NVIDIA GPU 上用 Megatron-LM 训练 GPT2 语言模型并转换到 Transformers。
Hugging Face 发布教程,演示如何在 AWS DL1 实例上借助 Habana Gaudi 从零预训练 BERT-base,使用 Transformers、Optimum Habana 和 Datasets 库,以 masked-language modeling 为预训练任务。
Hugging Face 发布 Sentence Transformers 训练与微调教程,讲解如何从零构建或从 Hub 加载模型,并以 distilroberta-base 加池化层为例说明其两层结构。