Hugging Face Diffusers 让 AudioLDM 2 推理提速超 10 倍
Hugging Face 在 🧨 Diffusers 库中优化 AudioLDM 2 文本到音频模型,通过半精度、flash attention、编译及调度器选择等手段,将推理时间缩短超 10 倍,10 秒音频样本生成从 30 秒以上降至 1 秒。AudioLDM 2 提供 1.1B 和 1.5B 三种 checkpoint,可生成音效、人声和音乐。
Hugging Face 在 🧨 Diffusers 库中优化 AudioLDM 2 文本到音频模型,通过半精度、flash attention、编译及调度器选择等手段,将推理时间缩短超 10 倍,10 秒音频样本生成从 30 秒以上降至 1 秒。AudioLDM 2 提供 1.1B 和 1.5B 三种 checkpoint,可生成音效、人声和音乐。
Hugging Face 把 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法将模型量化为 8、4、3 甚至 2-bit 精度运行,4-bit 量化精度损失可忽略,小批量下推理速度与 fp16 基线相当。
推荐理由:Hugging Face 官方说明 GPTQ 量化如何接入 Transformers 生态,读者可据此判断低比特部署的可行路径与限制。
OpenAI 宣布开发者现在可以用自己的数据微调 GPT-3.5 Turbo,以适配各自的用例,同时更新了 API。原文仅给出这一句说明,未披露微调价格、可用范围或具体 API 变更细节。
推荐理由:OpenAI 开放 GPT-3.5 Turbo 微调,开发者可用自有数据定制模型,是当时最受关注的 API 能力变化。
Hugging Face 发布 SafeCoder,一款面向企业的自托管代码助手解决方案,基于 StarCoder 系列代码大模型,代码在训练和推理阶段都不离开客户自有 VPC。
Hugging Face Hub 已上线 AWS Marketplace,用户可通过 AWS 账户订阅并支付 Hugging Face 的使用费用。订阅后,Inference Endpoints、Spaces 硬件升级和 AutoTrain 等服务的组织用量费用将自动计入 AWS 账单,价格与 Hugging Face 公开定价一致。连接需使用具备 admin 角色的组织账户,暂不支持个人账户。
Hugging Face 发布实战教程,演示如何用 Transformers、Optimum 和 Accelerate 三个库优化 Suno AI 的文本转语音模型 Bark。教程以 suno/bark-small 为例,基准测试显示未优化时单次生成耗时 9.38 秒、峰值显存占用 1.91 GB,并介绍了三种优化手段及其对比结果。
Hugging Face 博客演示如何用开源模型服务框架 BentoML 部署 DeepFloyd IF 文生图模型。DeepFloyd IF 直接在像素空间工作,由冻结文本编码器 T5-XXL-1.1 和三个级联像素扩散模块组成,分三阶段将 64x64 px 图像逐步放大至 1024x1024 px。
Hugging Face 发布 swift-transformers Swift 包及配套工具,让开发者在 Apple 设备上用 Core ML 本地运行 Llama 2、Falcon 等模型。
推荐理由:Hugging Face 放出在 Apple 设备本地跑 Llama 2 的 Swift 工具链,读者可据此了解端侧 LLM 的转换与优化路径。
Hugging Face 发布教程,介绍如何通过 Inference Endpoints 的自定义 handler 部署音乐生成模型 MusicGen。用户需复制 facebook/musicgen-large 仓库,添加 handler.py 和 requirements.txt,即可创建端点,16 GB RAM 实例即可运行。
Zama 展示如何借助全同态加密(FHE)在加密数据上运行大语言模型,并基于 Hugging Face transformers 库改造 GPT2 实现加密推理。
Hugging Face 与 Apple 将 Stable Diffusion XL 移植到 Core ML,可在 Apple Silicon Mac 上本地运行,并发布混合比特调色板量化方案。
推荐理由:原文给出混合比特调色板量化的具体压缩比与 PSNR 数据,可据此判断本地跑 SDXL 的体积与质量取舍。
Meta 发布开源大语言模型家族 Llama 2,包含 7B、13B、70B 三种规模的预训练与微调版本,采用允许商用的社区许可。Hugging Face 同步完成集成,提供模型卡、transformers 支持、Text Generation Inference 与 Inference Endpoints 部署,并给出用 PEFT 在单张 GPU 上微调 7B 版本的示例。
推荐理由:Meta 开源 Llama 2 并同步接入 Hugging Face 生态,读者可了解其许可、规模与推理微调路径。
Hugging Face 梳理了其平台上的开源文本生成与 LLM 生态,涵盖因果语言模型与 text-to-text 模型两类,并介绍了 PEFT 等工具。
Hugging Face 展示了在 Intel 第四代 Xeon(Sapphire Rapids)CPU 集群上微调 Stable Diffusion 的完整流程,利用 AMX 加速器与 IPEX、oneCCL 实现分布式训练。
Hugging Face 博客介绍如何用 Transformers.js 在浏览器本地运行机器学习模型,制作实时绘画猜词游戏 Doodle Dash。作者基于 Google Quick, Draw!
Hugging Face 发布教程,演示如何通过其托管 SaaS 服务 Inference Endpoints 部署 Falcon 40B instruct 等开源大模型,并支持流式响应与性能测试。
Hugging Face 发布教程,用 Node.js 结合 WizardCoder-15B 与 Inference Endpoints API 构建流式生成 HTML 的 Web 应用生成器。模型通过 textGenerationStream 边生成边渲染,配合 TailwindCSS 提示词让页面即时成型,也可改用免费的 Inference API 运行较小模型。
Writer 联合创始人兼 CTO Waseem Alshikh 与 Hugging Face 的 Jeff Boudier 对谈,讲述 Writer 从 Hugging Face 用户、客户到开源模型贡献者的历程。
Optimum Habana v1.7 在 Habana Gaudi2 上微调视觉语言模型 BridgeTower,相比 A100 提速 2.5 倍、相比 H100 提速 1.4 倍。这一提升依赖硬件加速的数据加载,通过 dataloader_num_workers 参数分配专用子进程即可启用,适用于各类受数据加载瓶颈制约的视觉模型。
Hugging Face 与 Panel 合作,在 Hugging Face Spaces 中集成了 Panel 模板,方便用户构建并部署 Panel 应用。Panel 是 HoloViz 生态下的开源 Python 库,支持 Matplotlib、Plotly、Bokeh 等绘图库,可构建仪表盘和多页交互应用,并借助 Pyodide 与 WebAssembly 在浏览器中运行。
Hugging Face 介绍了借助 Core ML 新优化在 Apple 设备上加速 Stable Diffusion 的方法,核心是 6-bit palettization 量化,把权重从 16 位浮点压缩到每参数 6 bit,并在推理时逐层解压以降低内存占用。
推荐理由:原文给出 6-bit palettization 的量化转换流程与已上传的四个 Stable Diffusion 模型,读者可据此在 Apple 设备上自行部署。
Hugging Face 与 Elixir 社区合作,演示了如何用 Livebook 构建一个基于 Whisper 的语音聊天应用并部署到 Hugging Face Spaces,全程不到 15 分钟。
OpenAI 宣布对 API 进行多项更新,包括更易引导的模型、函数调用能力、更长的上下文以及更低的价格。
推荐理由:OpenAI 公布 API 多项更新,读者可据此了解模型可控性、函数调用与价格的变化方向。
Hugging Face 宣布 AMD 正式加入其硬件合作伙伴计划,双方将针对 AMD CPU 和 GPU 优化 Transformer 模型的训练与推理。
Hugging Face 发布教程,讲解如何借助 Hugging Face Unity API 在 Unity 游戏中实现语音识别,可用于下达指令、与 NPC 对话或提升无障碍体验。教程从创建含开始/停止按钮和 TextMeshPro 文本框的场景入手,用 Microphone.Start() 以 44100 Hz 录制最长 10 秒音频,再编码为 WAV 格式发送给 API 转成文本。
Hugging Face 发布面向 Amazon SageMaker 的 LLM Inference DLC,基于 Text Generation Inference(TGI),可部署 BLOOM、StarCoder、Llama、T5 等开源大模型。
Hugging Face 联合 OpenVINO 的 NNCF 框架,通过量化感知训练(QAT)结合 Token Merging 优化 Stable Diffusion 的 UNet 模型,在 Intel CPU 上实现相比 PyTorch 5.1 倍推理加速和 4 倍模型体积缩减。
Hugging Face 与 bitsandbytes 合作,在 transformers 中支持以 4-bit 精度加载和运行模型,覆盖文本、视觉、多模态等大部分 HF 模型,并可在 4bit 模型上训练 LoRA 适配器。
推荐理由:Hugging Face 把 4-bit 量化与 QLoRA 微调接入 transformers,读者可据此判断消费级显卡能跑多大模型。
Hugging Face 与微软合作,在 Azure Machine Learning Studio 内推出 Hugging Face Hub 模型目录,收录数千个热门 Transformers 模型,用户可在托管端点上一键部署。该目录已在所有提供 Azure Machine Learning 的 Azure 区域开放公开预览。
Hugging Face 宣布与 IBM 合作,将其开源库集成到 IBM 的新一代企业 AI 工作室 watsonx.ai 中。watsonx.ai 基于 RedHat OpenShift 构建,支持云端和本地部署,并集成了 transformers、accelerate、peft 和 Text Generation Inference 等 Hugging Face 库。
Intel 用 SmoothQuant-O3 对 OPT 2.7B/6.7B、LLaMA 7B、Alpaca 7B、Vicuna 7B、BloomZ 7.1B、MPT-7B-chat 等模型做 8-bit 量化,模型体积缩小约 2 倍,多数评测指标不降反升。
Hugging Face 发布教程,介绍如何在单张 AMD GPU 上通过 ROCm 运行 13B 参数的 Vicuna 聊天机器人。Vicuna 由 UC Berkeley、CMU、斯坦福和 UCSD 团队基于 LLaMA 微调,使用约 70K 条 ShareGPT 对话数据,训练成本约 300 美元,据 GPT-4 评估质量达 ChatGPT 的 90% 以上。
Hugging Face 发布辅助生成(assisted generation)解码方法,通过小模型生成候选 token、大模型一次前向验证,在消费级硬件上最多降低 10 倍延迟。
推荐理由:Hugging Face 官方详解辅助生成解码原理与 Transformers 用法,读者可据此判断低延迟文本生成的可行路径。
Hugging Face Unity API 可将 Hugging Face Inference API 集成进 Unity 项目,开发者通过 Package Manager 添加 git URL 安装,并在 API Wizard 中填入 API key 即可调用模型。
Hugging Face 发布教程,演示如何用 🤗 Transformers 结合 TensorFlow 和 TPU 从零训练一个 RoBERTa base 模型,涵盖训练 tokenizer、在 WikiText v1 上分词并转为 TFRecord 存入 Google Cloud Storage,再到模型训练与上传的完整流程。
Hugging Face 博客介绍如何在免费版 Google Colab(13GB CPU 内存、15GB T4 显存)上用 diffusers 运行 DeepFloyd 的 IF 文生图模型。
推荐理由:原文给出在免费 Colab 上分阶段加载 IF 的完整代码与显存取舍,可迁移到其他大模型的低显存部署。
Hugging Face 发布教程,介绍如何将 Unity 游戏托管到 Hugging Face Space。步骤包括用 Static HTML 模板创建 Space、将 Unity 项目构建目标切换为 WebGL、把 Compression Format 设为 Disabled,并用 Git-LFS 推送构建文件。完成后即可在 Space 中直接游玩自己的 Unity 游戏。
Hugging Face 与 AWS 合作,将 Hugging Face Transformers 针对 AWS Inferentia2 推理加速器进行优化,通过 optimum-neuron 只需一行代码即可编译模型。
Snorkel AI 与 Hugging Face 达成合作,将 Hugging Face 的 Inference Endpoint 服务集成进 Snorkel Flow 平台,让企业用户可直接调用其超过 150,000 个开源模型来适配自身用例。
Hugging Face 用 Optimum Habana 在 Habana Gaudi2 上部署 176B 参数的 BLOOMZ,16-bit 精度下 8 卡推理延迟 3.103 秒,比 A100 80GB 的 4.402 秒快 1.42 倍。