Hugging Face:Transformer 对时间序列预测确实有效,Autoformer 已集成
Hugging Face 用实验反驳了 AAAI 2023 论文《Are Transformers Effective for Time Series Forecasting?
Hugging Face 用实验反驳了 AAAI 2023 论文《Are Transformers Effective for Time Series Forecasting?
Hugging Face 介绍了借助 Core ML 新优化在 Apple 设备上加速 Stable Diffusion 的方法,核心是 6-bit palettization 量化,把权重从 16 位浮点压缩到每参数 6 bit,并在推理时逐层解压以降低内存占用。
推荐理由:原文给出 6-bit palettization 的量化转换流程与已上传的四个 Stable Diffusion 模型,读者可据此在 Apple 设备上自行部署。
Hugging Face 现已托管 Meta AI 开源的 fastText 官方镜像,涵盖 157 种语言的词向量和最新语言识别模型。用户可通过 huggingface_hub 库的 hf_hub_download 命令直接下载使用,并支持文本分类与特征提取 widget。
Hugging Face Hub 现已集成 BERTopic,用户可直接在 Hub 上分享和加载主题模型。BERTopic 是一种基于 Transformer 嵌入向量与 c-TF-IDF 的主题建模技术,此次集成让主题模型也能像其他模型一样被托管和复用。
Hugging Face 联合 OpenVINO 的 NNCF 框架,通过量化感知训练(QAT)结合 Token Merging 优化 Stable Diffusion 的 UNet 模型,在 Intel CPU 上实现相比 PyTorch 5.1 倍推理加速和 4 倍模型体积缩减。
Hugging Face 与 bitsandbytes 合作,在 transformers 中支持以 4-bit 精度加载和运行模型,覆盖文本、视觉、多模态等大部分 HF 模型,并可在 4bit 模型上训练 LoRA 适配器。
推荐理由:Hugging Face 把 4-bit 量化与 QLoRA 微调接入 transformers,读者可据此判断消费级显卡能跑多大模型。
Hugging Face 博客介绍如何将 InstructPix2Pix 的训练策略与 FLAN 的指令模板思路结合,对 Stable Diffusion 做指令微调,使其按输入图像加指令完成卡通化、去雨等图像翻译与底层图像处理任务。
Hugging Face 博客详解 BigCode 项目采用 MinHash + LSH 进行大规模文档级近重复去重的方法,参数为 (256, 0.7, 5)。该方案已在 The Stack 代码数据集上验证,去重能提升代码模型性能并减少训练步数。文章还对比了 InCoder、CodeGen、AlphaCode 等模型所用的精确匹配与 MinHash 去重策略。
Hugging Face 官方博客宣布,结合 RNN 与 Transformer 优势的 RWKV 架构已集成进 transformers 库,可通过源码或主分支使用。
推荐理由:Hugging Face 官方博客介绍 RWKV 架构并入 transformers 库,读者可了解其兼顾 RNN 推理效率与 Transformer 训练并行的设计思路。
Hugging Face 发布辅助生成(assisted generation)解码方法,通过小模型生成候选 token、大模型一次前向验证,在消费级硬件上最多降低 10 倍延迟。
推荐理由:Hugging Face 官方详解辅助生成解码原理与 Transformers 用法,读者可据此判断低延迟文本生成的可行路径。
Hugging Face 发文梳理文本到视频模型的发展脉络,指出该任务比文本到图像更难,需保证帧间时空一致性,面临算力成本高、高质量数据集稀缺、视频描述模糊三大挑战。
BigCode 发布 StarCoder 与 StarCoderBase 两个代码大模型,基于 GitHub 宽松许可数据训练,覆盖 80 多种编程语言,参数规模约 15B、训练 1 万亿 token。
推荐理由:BigCode 公开了 StarCoder 的权重、训练数据与评测结果,读者可据此判断开源代码模型当时的能力水位。
Databricks 宣布向 Hugging Face 代码库提交首个官方贡献,新增 Datasets 的 from_spark 函数,可直接将 Apache Spark dataframe 转为 Hugging Face Dataset。
Hugging Face 发布 StackLLaMA 模型及完整 RLHF 训练流程,用 LLaMA 7B 在 Stack Exchange 问答数据上依次完成监督微调、奖励建模和 PPO 强化学习,训练管线已集成到 TRL 库。
推荐理由:Hugging Face 公开了用 RLHF 训练 LLaMA 的完整流程与代码,读者可据此复现或迁移到自己的模型对齐任务。
Hugging Face 官方发布 trl 与 peft 的集成,让大语言模型的 RLHF 微调成本大幅降低。方案先用 LLM.int8() 以 8 位精度加载模型,再用 peft 添加低秩适配器只训练少量参数,并借助 disable_adapters 复用同一模型获取参考模型与当前模型的 logits,从而省去第二份模型副本。
推荐理由:trl 与 peft 的集成给出了在 24GB 消费级 GPU 上做 RLHF 微调的具体路径,可迁移到自有训练流程。
Kakao Brain 与 Hugging Face 联合发布开源图文数据集 COYO(7 亿图文对)以及基于该数据集训练的 ViT 和 ALIGN 视觉语言模型,这是 ALIGN 模型首次免费开源,也是 ViT 和 ALIGN 首次附带训练数据集发布。
推荐理由:Kakao Brain 开源了首个可复现的 ALIGN 模型及配套 7 亿图文对数据集,读者可据此了解开放数据对视觉语言模型复现的意义。
Hugging Face 在 Diffusers 中集成 ControlNet,通过 StableDiffusionControlNetPipeline 支持 canny 边缘、OpenPose 姿态、深度图、分割图等多种空间条件控制图像生成。
推荐理由:Diffusers 官方给出 ControlNet 的完整接入方式与多种条件控制示例,可据此判断显存与速度开销。
Hugging Face 为 Mac 推出原生应用 🧨Diffusers 1.1,基于 Core ML 运行 Stable Diffusion 等文生图模型,生成速度最高提升至 2 倍。该版本会自动根据设备选择 GPU 或神经引擎(ANE)加速,并新增模型下载指示、复用 seed 等功能,已在 Mac App Store 上线且完全开源。
Hugging Face 博客介绍 Salesforce Research 的 BLIP-2 已集成进 Transformers,可用它完成图像描述、带提示词图像描述、视觉问答和对话式提示四类图像到文本任务。
Hugging Face 发布 PEFT 库,提供 LoRA、Prefix Tuning、Prompt Tuning、P-Tuning 等参数高效微调方法,并与 Transformers 和 Accelerate 集成。
推荐理由:原文给出 PEFT 库支持的方法与消费级硬件上的微调示例,读者可据此判断低成本微调的可行路径。
微软亚洲研究院的 SpeechT5 现已集成进 Hugging Face Transformers,官方 checkpoint 已发布在 Hugging Face Hub。
Hugging Face 发布开源工具 AI vs. AI,用于在多智能体环境中对强化学习模型进行排名。该工具托管于 Spaces,通过匹配算法让模型持续对战,并基于 ELO 评分系统(初始 1200 分)在 Leaderboard 上展示排名,用户将训练好的模型推送到 Hub 即可参与评估。
Hugging Face 在 diffusers 中正式支持 LoRA 微调 Stable Diffusion,训练脚本最低只需 11 GB 显存,产出的新增权重文件约 3 MB,比原 UNet 小约一千倍。
推荐理由:Hugging Face 官方给出 LoRA 微调 Stable Diffusion 的完整流程与显存、权重体积数据,可直接照做。
Hugging Face 与 Microsoft ONNX Runtime 团队合作,在 Optimum 库中集成 ONNX Runtime 训练后端,为多种 Hugging Face 模型带来 35% 以上的训练提速。
Hugging Face 与百度 PaddlePaddle 达成开源合作,PaddlePaddle 模型库将逐步集成至 Hugging Face Hub。目前 Hub 上已有超 75 个 PaddlePaddle 模型,包括 UIE、ERNIE 3.0、Ernie-Layout 等,并支持 Inference API 与交互式 Widget。
Hugging Face 发布教程,介绍如何用 Transformers 和 Datasets 库构建图像相似度系统,实现反向图像搜索等信息检索场景。方案采用 ViT 模型(nateraw/vit-base-beans)提取图像嵌入向量,再用余弦相似度匹配候选图像,示例使用 Beans 数据集,也可替换为 Swin Transformer、ConvNeXT、RegNet 等视觉模型。
Hugging Face 发布指南,介绍如何通过 transformers 使用零样本图像分割模型 CLIPSeg。该模型在冻结的 CLIP 之上训练 Transformer 解码器,可生成粗略分割掩码,用于机器人感知、图像修复等任务,并支持文本或图像作为提示进行视觉提示。CLIPSeg 使用 352 x 352 像素图像,输出分辨率较低,如需更精细结果可在 Segments.ai 上微调优化。
Hugging Face 推出模型卡创建工具和模型卡指南,前者提供图形界面,无需编程或 Markdown 即可协作编写模型卡。同时发布更新版模型卡模板(集成于 huggingface_hub 库)和带注释模板,并附上用户研究与文献综述。
Elixir 社区推出 Bumblebee 库,用纯 Elixir 实现了 Hugging Face Transformers,将 GPT2 到 Stable Diffusion 等神经网络模型引入 Elixir。
Hugging Face 博客介绍如何用 🤗 Transformers 库中的 Time Series Transformer 完成单变量概率时间序列预测。该模型基于 Encoder-Decoder Transformer 架构,通过 Ancestral Sampling 自回归生成预测,并支持将缺失值作为额外 mask 参与训练而无需插补。
中国科学技术大学与微软提出 VQ-Diffusion,一种在量化隐空间上执行加噪与去噪的条件扩散模型,隐空间由离散向量集合构成。该模型使用冻结的 VQ-VAE 编码图像,并以编码器-解码器 Transformer 近似反向过程,一次前向即可预测全部未加噪隐变量的分布。
Hugging Face 在 transformers 4.24.0 中加入对比搜索(Contrastive Search)解码方法,PyTorch 和 TensorFlow 均可用。
Hugging Face 用 🧨 Diffusers 的 Dreambooth 训练脚本做了大量实验,分析不同超参数对微调 Stable Diffusion 的影响并给出推荐设置。
推荐理由:基于大量实验给出 Dreambooth 微调 Stable Diffusion 的超参数建议,可迁移到自己的训练流程。
Hugging Face 将 Intel OpenVINO 集成进 Optimum Intel,用户可基于 OpenVINO 2022.2 在多种 Intel 处理器上对 Transformers 模型执行推理,并用 NNCF 在数分钟内完成量化以降低模型体积和预测延迟。
rinna 推出日语专用文生图模型 Japanese Stable Diffusion,通过在约 1 亿张日语标注图像上微调 Stable Diffusion 实现,可理解日语特有词汇、拟声词与专有名词。
Hugging Face 发布 Evaluation on the Hub,由 AutoTrain 驱动,无需写代码即可对 Hub 上任意因果语言模型做零样本评估,目前支持最高 660 亿参数模型,更大模型的支持即将推出。
Hugging Face 撰文解释 Accelerate 如何借助 PyTorch 在内存和显存不足的消费级硬件上加载并运行超大模型。它先用 meta device 创建空模型并计算 device map,再按分片逐步加载权重,把层分配到多张 GPU、CPU 内存乃至磁盘,最后通过 hooks 在每次前向传播前后搬运权重。
推荐理由:原文拆解了 Accelerate 借助 PyTorch meta device 与分片加载在有限显存下跑大模型的完整流程,可迁移到自己的推理部署。
Hugging Face 联合 Intel Labs 和 UKP Lab 发布 SetFit,一个面向 Sentence Transformers 的高效少样本微调框架,无需提示词或 verbaliser。
推荐理由:原文给出 SetFit 的两阶段训练流程、RAFT 基准对比与 30 秒训练成本,读者可据此判断少样本分类的落地门槛。
Hugging Face 发布教程,展示如何用 DeepSpeed-Inference、Accelerate 和 DeepSpeed ZeRO 为 176B 参数的 BLOOM 做推理,并给出 8x80GB A100 上的吞吐基准。
Hugging Face 发布 diffusers 0.3,为扩散模型工具箱新增图生图、文本反转、实验性修复(inpainting)等流水线,并加入面向小显存的优化,Stable Diffusion 显存占用可降至 3.2GB,代价是约 10% 的速度损失。
推荐理由:diffusers 0.3 集中补齐图生图、文本反转、修复与低显存优化,可据此判断扩散模型工具链的成熟度。