用 Hugging Face Inference Endpoints 部署嵌入模型
Hugging Face 发布教程,介绍如何通过 Text Embeddings Inference(TEI)将开源嵌入模型部署到 Hugging Face Inference Endpoints。
Hugging Face 发布教程,介绍如何通过 Text Embeddings Inference(TEI)将开源嵌入模型部署到 Hugging Face Inference Endpoints。
Hugging Face 发布 @gradio/lite,一个借助 Pyodide 让 Gradio 应用完全在浏览器中运行的 JavaScript 库,无需服务端基础设施。
推荐理由:Gradio 官方给出浏览器端无服务器运行方案,读者可据此判断前端部署与隐私场景的可行性。
Retool 借助 GPT-4 为企业提供快速、安全的 AI 应用构建方式。该方案面向商业场景,强调速度与安全性。
Ironclad 利用 GPT-4 简化合同审查流程。
Hugging Face 上已有超过 13 万个支持 ONNX 的模型可借助 ONNX Runtime 加速,其中包含众多 LLM 和云端模型。ONNX Runtime 已支持 90 多个 Hugging Face 模型架构,覆盖 BERT、GPT2、T5、Whisper、Stable-Diffusion 等最热门架构。
Hugging Face Diffusers 现已支持使用 JAX 在 Cloud TPU 上部署 SDXL,实现高性能、低成本的推理。演示运行在多个 TPU v5e-4 实例上,约 4 秒生成四张 1024×1024 图像,其中实际生成时间约 2.3 秒。
Hugging Face 的 tokenizers 新增 chat_template 属性,用 Jinja 模板保存模型训练时使用的对话格式,把消息列表转成正确格式的字符串。
推荐理由:Hugging Face 把聊天格式从硬编码改为随 tokenizer 保存的模板,读者可据此理解格式错配为何会静默拖垮模型表现。
Hugging Face 发布教程,介绍如何通过 Inference API 将 AI Comic Factory 复制并部署到自己的私有 Space,以避免官方 Space 的长时间等待。
Hugging Face 发布教程,展示非工程师如何零代码训练 LLaMA 2 聊天机器人。用户通过 Spaces、AutoTrain 和 ChatUI 三个工具,选用 Meta Llama 2 7b 基础模型和 Alpaca 指令数据集完成微调,再部署为可分享的聊天应用。
Mistral AI 发布 7.3B 参数的 Mistral 7B,称其在所有基准上超过 Llama 2 13B,并在多项基准上超过 Llama 1 34B,采用 Apache 2.0 许可可无限制使用。
推荐理由:Mistral 7B 以 7.3B 参数在多项基准上超过 Llama 2 13B,并采用 Apache 2.0 开源,读者可据此判断小模型的能力边界与部署成本。
Hugging Face 对 Llama 2 在 Amazon SageMaker 上的 60 种部署配置进行了基准测试,覆盖 7B、13B、70B 三种规模、四种 EC2 实例(含 NVIDIA A10G 与 A100 40GB)及 1/5/10/20 并发请求,并对比了 GPTQ 4-bit 量化效果。
Hugging Face 为 PRO 用户推出 Inference 服务,提供 Meta Llama 3 Instruct、Mixtral 8x7B Instruct、Zephyr 7B β、Code Llama 等精选模型的专属 API 端点,由 text-generation-inference 驱动,并提升免费 Inference API 的速率限制。
Rocket Money 用 Hugging Face Inference API 托管其基于 BERT 家族、覆盖 4000+ 类别的交易分类模型,替代原有正则系统,该系统每月处理超 1 亿笔交易且负载波动大。经过三个月评估和模拟峰值负载测试后,Rocket Money 放弃 AWS Sagemaker 与自建方案,选择 Hugging Face 托管模型。
Hugging Face 博客发布 3D Gaussian Splatting 入门解读,介绍这种从少量图像学习真实感场景并实时渲染的栅格化技术。文章拆解其完整流程:先用 COLMAP 等 Structure from Motion 方法估计点云,再把每个点转为高斯并训练,训练采用随机梯度下降配合自动加密与剪枝,最后通过可微高斯栅格化投影、按深度排序并逐像素混合。
Hugging Face 发布博客,梳理 LLM 生产部署的三大优化方向:8-bit 和 4-bit 低精度推理、Flash Attention 以及 Alibi、Rotary embeddings、MQA、GQA 等架构改进。
Hugging Face 发布教程,介绍如何用 PyTorch FSDP 结合 Transformers、Accelerate 和 TRL 微调 Llama 2 70B,并给出在 2 节点、每节点 8 张 80GB A100 上的配置。
Hugging Face Transformers 目前原生支持 bitsandbytes 和 auto-gptq 两种量化方案,前者无需校准数据即可开箱量化任意含 torch.nn.Linear 的模型,后者文本生成速度更快且支持 2-bit 量化。
Hugging Face 发布企业级代码助手 SafeCoder,基于 155 亿参数的 StarCoder 开源模型,支持 80 多种编程语言和 8192 token 上下文窗口。SafeCoder 提供闭源服务所缺乏的透明度、定制化、IT 灵活性和隐私保护,支持本地部署和完全离线运行,不会收集任何遥测数据。
Fetch 在 AWS 上使用 Hugging Face 与 Amazon SageMaker 优化其 ML 流水线,将最慢扫描的延迟降低 50%,文档理解模型准确率提升 200%。该公司在 12 个月内构建、训练并部署了超过五个 ML 模型,每周处理超 8000 万张收据,并于 2022 年底上线新版移动应用与 ML 流水线。
Hugging Face 在 🧨 Diffusers 库中优化 AudioLDM 2 文本到音频模型,通过半精度、flash attention、编译及调度器选择等手段,将推理时间缩短超 10 倍,10 秒音频样本生成从 30 秒以上降至 1 秒。AudioLDM 2 提供 1.1B 和 1.5B 三种 checkpoint,可生成音效、人声和音乐。
Hugging Face 把 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法将模型量化为 8、4、3 甚至 2-bit 精度运行,4-bit 量化精度损失可忽略,小批量下推理速度与 fp16 基线相当。
推荐理由:Hugging Face 官方说明 GPTQ 量化如何接入 Transformers 生态,读者可据此判断低比特部署的可行路径与限制。
OpenAI 宣布开发者现在可以用自己的数据微调 GPT-3.5 Turbo,以适配各自的用例,同时更新了 API。原文仅给出这一句说明,未披露微调价格、可用范围或具体 API 变更细节。
推荐理由:OpenAI 开放 GPT-3.5 Turbo 微调,开发者可用自有数据定制模型,是当时最受关注的 API 能力变化。
Hugging Face 发布 SafeCoder,一款面向企业的自托管代码助手解决方案,基于 StarCoder 系列代码大模型,代码在训练和推理阶段都不离开客户自有 VPC。
Hugging Face Hub 已上线 AWS Marketplace,用户可通过 AWS 账户订阅并支付 Hugging Face 的使用费用。订阅后,Inference Endpoints、Spaces 硬件升级和 AutoTrain 等服务的组织用量费用将自动计入 AWS 账单,价格与 Hugging Face 公开定价一致。连接需使用具备 admin 角色的组织账户,暂不支持个人账户。
Hugging Face 发布实战教程,演示如何用 Transformers、Optimum 和 Accelerate 三个库优化 Suno AI 的文本转语音模型 Bark。教程以 suno/bark-small 为例,基准测试显示未优化时单次生成耗时 9.38 秒、峰值显存占用 1.91 GB,并介绍了三种优化手段及其对比结果。
Hugging Face 博客演示如何用开源模型服务框架 BentoML 部署 DeepFloyd IF 文生图模型。DeepFloyd IF 直接在像素空间工作,由冻结文本编码器 T5-XXL-1.1 和三个级联像素扩散模块组成,分三阶段将 64x64 px 图像逐步放大至 1024x1024 px。
Hugging Face 发布 swift-transformers Swift 包及配套工具,让开发者在 Apple 设备上用 Core ML 本地运行 Llama 2、Falcon 等模型。
推荐理由:Hugging Face 放出在 Apple 设备本地跑 Llama 2 的 Swift 工具链,读者可据此了解端侧 LLM 的转换与优化路径。
Hugging Face 发布教程,介绍如何通过 Inference Endpoints 的自定义 handler 部署音乐生成模型 MusicGen。用户需复制 facebook/musicgen-large 仓库,添加 handler.py 和 requirements.txt,即可创建端点,16 GB RAM 实例即可运行。
Zama 展示如何借助全同态加密(FHE)在加密数据上运行大语言模型,并基于 Hugging Face transformers 库改造 GPT2 实现加密推理。
Hugging Face 与 Apple 将 Stable Diffusion XL 移植到 Core ML,可在 Apple Silicon Mac 上本地运行,并发布混合比特调色板量化方案。
推荐理由:原文给出混合比特调色板量化的具体压缩比与 PSNR 数据,可据此判断本地跑 SDXL 的体积与质量取舍。
Meta 发布开源大语言模型家族 Llama 2,包含 7B、13B、70B 三种规模的预训练与微调版本,采用允许商用的社区许可。Hugging Face 同步完成集成,提供模型卡、transformers 支持、Text Generation Inference 与 Inference Endpoints 部署,并给出用 PEFT 在单张 GPU 上微调 7B 版本的示例。
推荐理由:Meta 开源 Llama 2 并同步接入 Hugging Face 生态,读者可了解其许可、规模与推理微调路径。
Hugging Face 梳理了其平台上的开源文本生成与 LLM 生态,涵盖因果语言模型与 text-to-text 模型两类,并介绍了 PEFT 等工具。
Hugging Face 展示了在 Intel 第四代 Xeon(Sapphire Rapids)CPU 集群上微调 Stable Diffusion 的完整流程,利用 AMX 加速器与 IPEX、oneCCL 实现分布式训练。
Hugging Face 博客介绍如何用 Transformers.js 在浏览器本地运行机器学习模型,制作实时绘画猜词游戏 Doodle Dash。作者基于 Google Quick, Draw!
Hugging Face 发布教程,演示如何通过其托管 SaaS 服务 Inference Endpoints 部署 Falcon 40B instruct 等开源大模型,并支持流式响应与性能测试。
Hugging Face 发布教程,用 Node.js 结合 WizardCoder-15B 与 Inference Endpoints API 构建流式生成 HTML 的 Web 应用生成器。模型通过 textGenerationStream 边生成边渲染,配合 TailwindCSS 提示词让页面即时成型,也可改用免费的 Inference API 运行较小模型。
Writer 联合创始人兼 CTO Waseem Alshikh 与 Hugging Face 的 Jeff Boudier 对谈,讲述 Writer 从 Hugging Face 用户、客户到开源模型贡献者的历程。
Optimum Habana v1.7 在 Habana Gaudi2 上微调视觉语言模型 BridgeTower,相比 A100 提速 2.5 倍、相比 H100 提速 1.4 倍。这一提升依赖硬件加速的数据加载,通过 dataloader_num_workers 参数分配专用子进程即可启用,适用于各类受数据加载瓶颈制约的视觉模型。
Hugging Face 与 Panel 合作,在 Hugging Face Spaces 中集成了 Panel 模板,方便用户构建并部署 Panel 应用。Panel 是 HoloViz 生态下的开源 Python 库,支持 Matplotlib、Plotly、Bokeh 等绘图库,可构建仪表盘和多页交互应用,并借助 Pyodide 与 WebAssembly 在浏览器中运行。
Hugging Face 介绍了借助 Core ML 新优化在 Apple 设备上加速 Stable Diffusion 的方法,核心是 6-bit palettization 量化,把权重从 16 位浮点压缩到每参数 6 bit,并在推理时逐层解压以降低内存占用。
推荐理由:原文给出 6-bit palettization 的量化转换流程与已上传的四个 Stable Diffusion 模型,读者可据此在 Apple 设备上自行部署。