用 Transformers 进行图分类:基于 Graphormer 的实战教程
Hugging Face 发布教程,演示如何用 Transformers 库(需 >= 4.27.2)进行图分类,目前该库中唯一的图 Transformer 模型是微软的 Graphormer。教程以 Stanford OGB 的 ogbg-molhiv 数据集为例,介绍数据加载、Graphormer 默认预处理及加载预训练 checkpoint 微调的二分类流程。
Hugging Face 发布教程,演示如何用 Transformers 库(需 >= 4.27.2)进行图分类,目前该库中唯一的图 Transformer 模型是微软的 Graphormer。教程以 Stanford OGB 的 ogbg-molhiv 数据集为例,介绍数据加载、Graphormer 默认预处理及加载预训练 checkpoint 微调的二分类流程。
Hugging Face 与开源联邦学习框架 Substra 合作创建了一个演示空间,展示如何在数据不出本地的前提下训练模型。联邦学习只传输模型权重而非原始数据,用多来源数据训练的模型在验证集上几乎总是优于单一来源模型。Substra 已在乳腺癌研究和 MELLODDY 项目中得到实际验证。
Snorkel AI 与 Hugging Face 达成合作,将 Hugging Face 的 Inference Endpoint 服务集成进 Snorkel Flow 平台,让企业用户可直接调用其超过 150,000 个开源模型来适配自身用例。
Hugging Face 发布 StackLLaMA 模型及完整 RLHF 训练流程,用 LLaMA 7B 在 Stack Exchange 问答数据上依次完成监督微调、奖励建模和 PPO 强化学习,训练管线已集成到 TRL 库。
推荐理由:Hugging Face 公开了用 RLHF 训练 LLaMA 的完整流程与代码,读者可据此复现或迁移到自己的模型对齐任务。
Hugging Face 发布《伦理与社会通讯 #3》,阐述其在开放 ML 中兼顾伦理的做法。平台推出 6 个伦理标签(严谨、知情同意、社会意识、可持续、包容、探究)帮助用户发现伦理相关项目,并上线举报功能,让社区标记违反内容准则的模型、数据集或 Space。此外还通过模型卡记录社会影响与偏见、推广 Open RAIL 许可证、监控讨论区等方式降低开放发布带来的风险。
Hugging Face 用 Optimum Habana 在 Habana Gaudi2 上部署 176B 参数的 BLOOMZ,16-bit 精度下 8 卡推理延迟 3.103 秒,比 A100 80GB 的 4.402 秒快 1.42 倍。
Hugging Face 展示了在 Intel Sapphire Rapids CPU 上加速 Stable Diffusion 推理的多种技术。
Hugging Face 发布教程,演示如何用 Flower 框架在多个客户端上联邦微调预训练 Transformer 模型 distilBERT,用于 IMDB 影评情感分类。教程使用 datasets、evaluate、flwr、torch 和 transformers 等库,并提供了在 Google Colab 中通过 Flower 模拟功能复现联邦设置的 notebook。
Hugging Face 发布教程,讲解如何用 diffusers 训练 ControlNet,并以人脸姿态为例走完条件设计、数据集构建和模型训练三步。数据集基于微软 FaceSynthetics 的 100K 合成人脸,用 SPIGA 提取 iBUG 68 点关键点生成条件图,再用 BLIP 生成 caption。
推荐理由:Hugging Face 官方复盘了从条件设计、数据集构建到 diffusers 训练脚本的完整 ControlNet 训练流程,并给出不同显存下的参数配置。
Hugging Face Hub 新增 Jupyter notebook 渲染支持,托管在 Hub 上的 ipynb 文件将以人类可读格式显示,不再直接呈现原始 JSON。Hub 目前已托管超 7,000 个 notebook,并支持一键在 Google Colab 中打开。
Hugging Face 在 🤗 Transformers 中上线了 AAAI21 最佳论文模型 Informer,并演示如何用它完成多变量概率时间序列预测。
Hugging Face 官方发布 trl 与 peft 的集成,让大语言模型的 RLHF 微调成本大幅降低。方案先用 LLM.int8() 以 8 位精度加载模型,再用 peft 添加低秩适配器只训练少量参数,并借助 disable_adapters 复用同一模型获取参考模型与当前模型的 logits,从而省去第二份模型副本。
推荐理由:trl 与 peft 的集成给出了在 24GB 消费级 GPU 上做 RLHF 微调的具体路径,可迁移到自有训练流程。
Kakao Brain 与 Hugging Face 联合发布开源图文数据集 COYO(7 亿图文对)以及基于该数据集训练的 ViT 和 ALIGN 视觉语言模型,这是 ALIGN 模型首次免费开源,也是 ViT 和 ALIGN 首次附带训练数据集发布。
推荐理由:Kakao Brain 开源了首个可复现的 ALIGN 模型及配套 7 亿图文对数据集,读者可据此了解开放数据对视觉语言模型复现的意义。
Hugging Face 在 Diffusers 中集成 ControlNet,通过 StableDiffusionControlNetPipeline 支持 canny 边缘、OpenPose 姿态、深度图、分割图等多种空间条件控制图像生成。
推荐理由:Diffusers 官方给出 ControlNet 的完整接入方式与多种条件控制示例,可据此判断显存与速度开销。
2023 年 2 月 6 日土耳其东南部发生 7.7 和 7.6 级地震后,一群程序员在 Discord 上协作开发了名为 afetharita(灾害地图)的应用,用于从幸存者的推文和截图中提取地址与需求信息,供搜救队和志愿者使用。
推荐理由:作者以志愿者身份复盘土耳其地震救援中的模型选型与部署流程,可迁移到快速搭建应急类 ML 应用。
Hugging Face 为 Diffusers 库发布伦理框架,用于指导维护者处理社区贡献时的技术决策,并承诺随时间与社区反馈持续调整。准则涵盖透明、一致、简洁、可访问、可复现与责任六项价值观,同时列出 Community tab、Tag 标记、偏见探索与评估等安全功能,以及 Safe Stable Diffusion、Hub 分阶段发布和 OpenRAILs 许可等部署安全机制。
Hugging Face 专家加速计划帮助 Witty Works 将其包容性写作助手的非包容性词汇分类器从 vanilla transformers 转向 Sentence Transformers 架构,并结合 SetFit 库实现少样本微调,每个词仅需 15-20 条标注句子。
红队测试通过构造自然语言提示词诱导大语言模型暴露有害输出,与对抗攻击不同,其提示词对人类可读。GPT3 早期版本曾表现出性别歧视与针对穆斯林的偏见,微软 Tay 和 Bing 的 Sydney 是缺乏红队评估导致灾难性后果的真实案例。
Hugging Face 为 Mac 推出原生应用 🧨Diffusers 1.1,基于 Core ML 运行 Stable Diffusion 等文生图模型,生成速度最高提升至 2 倍。该版本会自动根据设备选择 GPU 或神经引擎(ANE)加速,并新增模型下载指示、复用 seed 等功能,已在 Mac App Store 上线且完全开源。
消费者奖励公司 Fetch 借助 AWS 合作伙伴 Hugging Face 的专家加速计划,将原本依赖第三方黑盒的票据处理方案改为自研 AI/ML 模型,开发时间缩短 30%。其平台基于 Amazon SageMaker 和 AWS Inferentia 构建,每天可处理超 1100 万张收据,处理延迟降低 50%,服务 1800 万月活用户。
Hugging Face 与 AWS 扩大长期战略合作,Hugging Face 将 AWS 作为首选云服务商,开发者可通过 Amazon SageMaker、AWS Trainium 和 AWS Inferentia 训练、微调并部署模型。
Hugging Face 推出托管服务 Inference Endpoints,可将 Hub 上的模型部署到 AWS 等云端的多种实例类型(含 GPU)。团队将原本跑在 AWS ECS + Fargate 上的 CPU 推理模型迁移过去,部署流程从六步简化为三步。测试显示 large 实例延迟约 80ms,比原方案快一倍以上,但成本高出 24% 至 50%。
Hugging Face 博客介绍 Salesforce Research 的 BLIP-2 已集成进 Transformers,可用它完成图像描述、带提示词图像描述、视觉问答和对话式提示四类图像到文本任务。
Hugging Face 发布 PEFT 库,提供 LoRA、Prefix Tuning、Prompt Tuning、P-Tuning 等参数高效微调方法,并与 Transformers 和 Accelerate 集成。
推荐理由:原文给出 PEFT 库支持的方法与消费级硬件上的微调示例,读者可据此判断低成本微调的可行路径。
微软亚洲研究院的 SpeechT5 现已集成进 Hugging Face Transformers,官方 checkpoint 已发布在 Hugging Face Hub。
Hugging Face 发布开源工具 AI vs. AI,用于在多智能体环境中对强化学习模型进行排名。该工具托管于 Spaces,通过匹配算法让模型持续对战,并基于 ELO 评分系统(初始 1200 分)在 Leaderboard 上展示排名,用户将训练好的模型推送到 Hub 即可参与评估。
Hugging Face 博客"AI for Game Development"系列第 5 篇展示了用 ChatGPT 为农场游戏生成剧情:先让模型写故事梗概,结果与《星露谷物语》高度雷同,经多轮要求"更有原创性"并去除魔法元素后才可用。作者指出语言模型易复现已有故事、长文本易重复,直接使用 AI 输出可能带来法律、伦理与商业风险,建议仅用于头脑风暴,最终内容手写。
Hugging Face 联合 Intel 测试了 PyTorch Transformers 在第四代 Xeon(Sapphire Rapids)上的推理性能,对比上一代 Ice Lake,在 distilbert-base-uncased、bert-base-uncased、roberta-base 三个模型上测量了 16 与 128 token 句子的单条及批量推理延迟。
Hugging Face 发布博客深入解析视觉-语言模型的训练策略,涵盖对比学习、PrefixLM、交叉注意力多模态融合、MLM/ITM 以及免训练方法等五类预训练目标。文章以 OpenAI 的 CLIP 为例说明对比学习如何将图像与文本映射到同一特征空间,并介绍如何用 🤗 Transformers 上手这些模型。
Hugging Face 公布其计算机视觉生态进展:Hub 上已支持 8 项核心视觉任务、超过 3000 个模型和 100 多个数据集,涵盖图像分类、分割、目标检测、深度估计等,并兼容 ViT、Swin、DETR 及 ConvNeXt、ResNet 等架构。
Hugging Face 博客"AI for Game Development"系列第 4 篇讲解如何用 Stable Diffusion 的 Image2Image 生成 2D 游戏资产,并以农场游戏的玉米和镰刀图标为例演示完整流程。
Hugging Face 在 diffusers 中正式支持 LoRA 微调 Stable Diffusion,训练脚本最低只需 11 GB 显存,产出的新增权重文件约 3 MB,比原 UNet 小约一千倍。
推荐理由:Hugging Face 官方给出 LoRA 微调 Stable Diffusion 的完整流程与显存、权重体积数据,可直接照做。
Hugging Face 与 Microsoft ONNX Runtime 团队合作,在 Optimum 库中集成 ONNX Runtime 训练后端,为多种 Hugging Face 模型带来 35% 以上的训练提速。
Hugging Face 博客梳理了让对话智能体变得有用的关键技术,包括指令微调(IFT)、监督微调(SFT)、思维链(CoT)和基于人类反馈的强化学习(RLHF)。
推荐理由:梳理 IFT、SFT、CoT 与 RLHF 在对话智能体中的作用,并对比多家早期聊天机器人的训练与评测差异。
Hugging Face 博客"AI for Game Development"系列第 3 篇指出,text-to-3D 目前还无法实际用于游戏开发,生成的 mesh 无法直接用于游戏,仍需大量人工后处理。
Mask2Former 和 OneFormer 两款统一图像分割模型现已集成到 Hugging Face 开源库 transformers 中。Mask2Former 用同一架构解决实例、语义和全景分割,但需分任务训练;OneFormer 仅在全景数据上训练一次即可在三个任务上达到 SOTA,代价是额外的文本编码器带来更高延迟。作者已发布 30 个基于不同数据集训练的 checkpoint。
Hugging Face 与百度 PaddlePaddle 达成开源合作,PaddlePaddle 模型库将逐步集成至 Hugging Face Hub。目前 Hub 上已有超 75 个 PaddlePaddle 模型,包括 UIE、ERNIE 3.0、Ernie-Layout 等,并支持 Inference API 与交互式 Widget。
Hugging Face 发布教程,介绍如何用 Transformers 和 Datasets 库构建图像相似度系统,实现反向图像搜索等信息检索场景。方案采用 ViT 模型(nateraw/vit-base-beans)提取图像嵌入向量,再用余弦相似度匹配候选图像,示例使用 Beans 数据集,也可替换为 Swin Transformer、ConvNeXT、RegNet 等视觉模型。
Hugging Face 博客系列教程第二部分展示如何用 ChatGPT 辅助游戏设计,作者以 5 天开发农场游戏为例,让 ChatGPT 以专业游戏设计师身份给出作物多样性、进阶系统、社交玩法等建议,并据此灰盒实现了前两项。文章同时说明 ChatGPT 基于 Transformer 与 RLHF,常言之凿凿却出错,宜作头脑风暴与加速工具而非开发流程的替代品。
Hugging Face 发布图机器学习入门博客,梳理图的基本概念、表示方式与任务类型,涵盖图生成、节点/边属性预测、缺失边预测和社区检测等。文章从非神经方法讲到图神经网络(GNN),并进一步介绍用于图的 Transformer。