Writer 如何借助 Hugging Face 从用户成长为开源模型贡献者
Writer 联合创始人兼 CTO Waseem Alshikh 与 Hugging Face 的 Jeff Boudier 对谈,讲述 Writer 从 Hugging Face 用户、客户到开源模型贡献者的历程。
Writer 联合创始人兼 CTO Waseem Alshikh 与 Hugging Face 的 Jeff Boudier 对谈,讲述 Writer 从 Hugging Face 用户、客户到开源模型贡献者的历程。
Hugging Face 发布《伦理与社会通讯》第 4 期,聚焦文本到图像模型的偏见问题,指出训练数据、预训练数据过滤、推理、模型潜在空间及事后过滤等环节均可能引入偏见。
Hugging Face 发文解释 Open LLM Leaderboard 上 LLaMA 的 MMLU 分数为何明显低于 LLaMA 论文中的数字。
推荐理由:同一份 MMLU 数据集在三种实现下分数与排名都不同,读者可据此理解评测数字为何不可直接横向比较。
Hugging Face 于 6 月 12 日向美国商务部 NTIA 提交 AI 问责政策回应,强调文档与透明度规范在推动 AI 问责中的作用。其建议问责机制应覆盖 ML 开发全流程、结合内部要求与外部访问透明,并吸纳开发者、多学科研究社区、倡导组织、政策制定者和记者等最广泛参与者。
Hugging Face 发布教程,介绍如何基于 Meta AI 的 MMS 检查点微调 Adapter 层实现低资源语音识别。MMS 预训练检查点覆盖 1400 多种语言、参数量 300M 到 1B,每个 Adapter 层仅约 2.5M 权重,微调 10-20 分钟即可获得极低词错误率。低资源语言推荐用 Adapter 训练替代全模型微调,更省内存且性能更好。
Hugging Face 更新了平台内容政策,并发布配套博客说明其制定理由与核心价值。新政策针对机器学习内容的审核难题,强调以"同意"为核心价值,关注用户对自身作品、形象与隐私的权利,同时禁止针对用户及 Hugging Face 员工的攻击性或骚扰性言论。
Hugging Face 宣布 AMD 正式加入其硬件合作伙伴计划,双方将针对 AMD CPU 和 GPU 优化 Transformer 模型的训练与推理。
Hugging Face Hub 面向美术馆、图书馆、档案馆与博物馆(GLAM)从业者,介绍如何查找模型并上传馆藏数据集。Hub 目前托管超 190,000 个模型、33,000 个数据集和超 100,000 个应用与 demo,覆盖文本、图像、音频等任务。文中以挪威文献的命名实体识别(NER)模型为例,并演示通过浏览器界面将 CSV 数据集上传为数据集仓库。
阿布扎比 TII 发布 Apache 2.0 许可的 Falcon 语言模型家族,包含 Falcon-40B 和 Falcon-7B 两个基础模型及对应 Instruct 版本。
推荐理由:梳理 Falcon 系列在 Hugging Face 生态中的推理、量化与微调路径,可了解开源大模型的落地方式。
Hugging Face 宣布举办首届 Open Source AI Game Jam,活动时间为 7 月 7 日至 9 日,参与者需在周末内用 AI 工具制作一款游戏。
Hugging Face 发布面向 Amazon SageMaker 的 LLM Inference DLC,基于 Text Generation Inference(TGI),可部署 BLOOM、StarCoder、Llama、T5 等开源大模型。
Hugging Face 联合 EleutherAI 和 Stability AI 委托 Trail of Bits 对 safetensors 库进行外部安全审计,未发现可导致任意代码执行的关键安全漏洞,并已修复规范格式不精确和允许 polyglot 文件的验证缺失问题。
推荐理由:Hugging Face 联合 EleutherAI、Stability AI 公开 safetensors 外部安全审计结果,读者可了解该格式为何被推向默认。
Hugging Face 宣布与 IBM 合作,将其开源库集成到 IBM 的新一代企业 AI 工作室 watsonx.ai 中。watsonx.ai 基于 RedHat OpenShift 构建,支持云端和本地部署,并集成了 transformers、accelerate、peft 和 Text Generation Inference 等 Hugging Face 库。
Hugging Face 发布教程,介绍如何在单张 AMD GPU 上通过 ROCm 运行 13B 参数的 Vicuna 聊天机器人。Vicuna 由 UC Berkeley、CMU、斯坦福和 UCSD 团队基于 LLaMA 微调,使用约 70K 条 ShareGPT 对话数据,训练成本约 300 美元,据 GPT-4 评估质量达 ChatGPT 的 90% 以上。
Hugging Face 团队介绍如何将 16B 参数的 StarCoder 微调为对话式编码助手 StarChat,使用 OpenAssistant 约 2.1 万条英文对话数据,并采用 ChatML 格式标记角色、屏蔽用户轮次的损失。
推荐理由:原文完整给出用对话数据微调 StarCoder 的流程与代码,读者可据此复现一个开源编码助手。
Hugging Face 上线中文博客 hf.co/blog/zh,由志愿者翻译 transformers、diffusion 和强化学习等博客与课程内容。官方同时提到 HuggingGPT、ChatGLM、RWKV、ChatYuan、ModelScope 文生视频模型及 IDEA CCNL、BAAI 等中国社区成果,并已与 PaddlePaddle 等合作推进集成。
Hugging Face 与开源联邦学习框架 Substra 合作创建了一个演示空间,展示如何在数据不出本地的前提下训练模型。联邦学习只传输模型权重而非原始数据,用多来源数据训练的模型在验证集上几乎总是优于单一来源模型。Substra 已在乳腺癌研究和 MELLODDY 项目中得到实际验证。
Snorkel AI 与 Hugging Face 达成合作,将 Hugging Face 的 Inference Endpoint 服务集成进 Snorkel Flow 平台,让企业用户可直接调用其超过 150,000 个开源模型来适配自身用例。
Hugging Face 发布《伦理与社会通讯 #3》,阐述其在开放 ML 中兼顾伦理的做法。平台推出 6 个伦理标签(严谨、知情同意、社会意识、可持续、包容、探究)帮助用户发现伦理相关项目,并上线举报功能,让社区标记违反内容准则的模型、数据集或 Space。此外还通过模型卡记录社会影响与偏见、推广 Open RAIL 许可证、监控讨论区等方式降低开放发布带来的风险。
Hugging Face 发布教程,演示如何用 Flower 框架在多个客户端上联邦微调预训练 Transformer 模型 distilBERT,用于 IMDB 影评情感分类。教程使用 datasets、evaluate、flwr、torch 和 transformers 等库,并提供了在 Google Colab 中通过 Flower 模拟功能复现联邦设置的 notebook。
Hugging Face 为 Diffusers 库发布伦理框架,用于指导维护者处理社区贡献时的技术决策,并承诺随时间与社区反馈持续调整。准则涵盖透明、一致、简洁、可访问、可复现与责任六项价值观,同时列出 Community tab、Tag 标记、偏见探索与评估等安全功能,以及 Safe Stable Diffusion、Hub 分阶段发布和 OpenRAILs 许可等部署安全机制。
Hugging Face 与 AWS 扩大长期战略合作,Hugging Face 将 AWS 作为首选云服务商,开发者可通过 Amazon SageMaker、AWS Trainium 和 AWS Inferentia 训练、微调并部署模型。
Hugging Face 发布博客深入解析视觉-语言模型的训练策略,涵盖对比学习、PrefixLM、交叉注意力多模态融合、MLM/ITM 以及免训练方法等五类预训练目标。文章以 OpenAI 的 CLIP 为例说明对比学习如何将图像与文本映射到同一特征空间,并介绍如何用 🤗 Transformers 上手这些模型。
Hugging Face 博客"AI for Game Development"系列第 4 篇讲解如何用 Stable Diffusion 的 Image2Image 生成 2D 游戏资产,并以农场游戏的玉米和镰刀图标为例演示完整流程。
Hugging Face 博客"AI for Game Development"系列第 3 篇指出,text-to-3D 目前还无法实际用于游戏开发,生成的 mesh 无法直接用于游戏,仍需大量人工后处理。
Mask2Former 和 OneFormer 两款统一图像分割模型现已集成到 Hugging Face 开源库 transformers 中。Mask2Former 用同一架构解决实例、语义和全景分割,但需分任务训练;OneFormer 仅在全景数据上训练一次即可在三个任务上达到 SOTA,代价是额外的文本编码器带来更高延迟。作者已发布 30 个基于不同数据集训练的 checkpoint。
Hugging Face 博客推出"AI for Game Development"系列教程,演示如何在 5 天内用 AI 工具做出一个完整农场游戏。
Hugging Face 发布图解 RLHF 的教程文章,把训练流程拆成预训练语言模型、收集偏好数据训练奖励模型、用 PPO 微调语言模型三个核心步骤。文章指出奖励模型输出标量奖励,训练时用 KL 散度惩罚约束策略偏离初始模型,并介绍了 TRL、TRLX、RL4LMs 等开源 RLHF 工具。文中还提到人类标注成本高、标注者意见不一致等局限,以及离线 RL、ILQL 等尚未充分探索的方向。
推荐理由:把 RLHF 拆成预训练、奖励模型、PPO 微调三步,并梳理了开源实现与已知局限,适合作为入门框架参考。
Hugging Face 发布面向生物学家与机器学习者的蛋白质深度学习入门文章,并附上微调蛋白质语言模型(PyTorch、TensorFlow)和用 ESMFold 做蛋白质折叠(仅 PyTorch)的示例 notebook。文章从 2018 年 ULMFiT 与 BERT 讲起,说明迁移学习如何把预训练知识复用到新任务,并指出其效果常相当于 100 倍以上的训练数据。
Hugging Face 与 Jonathan Whitaker 合作的扩散模型课程将于 11 月 28 日发布,配套社区直播活动定于 11 月 30 日举行。
Hugging Face 发文梳理 Document AI 的六大用例及对应开源模型,涵盖 OCR、文档图像分类、版面分析、文档解析等任务。文档图像分类中,LayoutLMv3 和 Donut 等多模态模型在 RVL-CDIP 上可达 95% 准确率,优于 BERT-base 的 89% 和纯视觉 DiT 的 92%。
Hugging Face 与 arXiv 合作,将 Spaces 通过 arXivLabs 集成到论文页面,新增 Demo 标签页,可直接链接社区或作者创建的开源演示。自 2021 年 10 月上线以来,Spaces 已托管超过 12,000 个开源机器学习演示,基于 Gradio 和 Streamlit 构建。以 BERT 论文为例,其 arXiv 页面已可找到 200 多个相关演示。
Hugging Face 发布教程,介绍如何用 Transformers 在任意多语言 ASR 数据集上微调 Whisper,涵盖 Common Voice 数据准备、特征提取器与 tokenizer 配置、训练评估及 Gradio 演示的完整代码。
推荐理由:原文给出用 Transformers 微调 Whisper 的完整代码流程,并附 8 小时数据把 WER 从 63.5% 降到 32.0% 的实测结果。
Hugging Face 发布教程,演示如何通过三个递进抽象层级实现多 GPU 分布式训练:原生 PyTorch DDP(torch.distributed)、🤗 Accelerate 轻量封装(无需改代码即可支持单 GPU 和 TPU)、以及 🤗 Transformer 的 Trainer API。
Hugging Face 分享了 BLOOM(176B 参数、bf16 下 352GB)推理服务的优化过程,数周内将延迟降低 5 倍、吞吐提升 50 倍。团队先用 Megatron-Deepspeed 训练,再由 Younes 耗时近一个月、200 次 commit 移植到 transformers,并借助 accelerate 的 device_map="auto" 做流水线并行分片。
Hugging Face 宣布用户可直接在 Hub 上为模型或数据集生成 DOI,该功能与 DataCite 合作实现,注册用户填写元数据后即可获得,他人可通过模型或数据集页面的“Cite this model/dataset”按钮引用。DOI 绑定对象的 URL、版本、创建日期等元数据,提供永久链接,模型或数据集新版本发布时 DOI 可更新,旧版本 DOI 随之失效。
Hugging Face 发布首期 Ethics and Society 通讯,计划按季节在春分、秋分、夏至、冬至发布,由公司内部跨部门开放小组“Ethics and Society regulars”以平等身份共同编写。该通讯围绕协作、责任与透明等原则,分享 Hugging Face 在机器学习伦理落地方面的思考与项目实践,并明确不设统一价值观清单,而是持续输出项目层面的具体讨论。
OpenAI 宣布训练并开源神经网络 Whisper,称其在英文语音识别上接近人类水平的鲁棒性与准确率。
推荐理由:OpenAI 开源语音识别模型 Whisper,读者可据此了解其在英文语音识别上的鲁棒性与准确率定位。
Hugging Face 发布教程,演示如何用 transformers 库的 Trainer 和自定义 Data Collator,从零训练一个离线 Decision Transformer,让 HalfCheetah 机器人学会奔跑。
RAIL Initiative 推出、Hugging Face 支持的 OpenRAIL 是一类 AI 专用许可,允许免版税获取、下游使用与再分发,同时嵌入针对特定关键场景的用途限制。它借鉴 BigScience、开源与 Creative Commons 的做法,试图在广泛开放与防范有害使用之间划出界线,并赋予许可方在模型被滥用时的执行能力。