用 TRL 的 DDPO 微调 Stable Diffusion 模型
Hugging Face 在 trl 库中集成 DDPOTrainer,可用 DDPO(Denoising Diffusion Policy Optimization)对 Stable Diffusion 做强化学习微调。
Hugging Face 在 trl 库中集成 DDPOTrainer,可用 DDPO(Denoising Diffusion Policy Optimization)对 Stable Diffusion 做强化学习微调。
Hugging Face 发布伦理与社会通讯第 5 期,回顾其今夏参与 E.U.、U.K.、U.S. 的 AI 监管讨论,CEO Clem 出席美国国会作证及参议院 AI Insight Forum,并提交对 E.U. AI Act 和 NTIA AI 问责制的建议。
Hugging Face 发布教程,展示非工程师如何零代码训练 LLaMA 2 聊天机器人。用户通过 Spaces、AutoTrain 和 ChatUI 三个工具,选用 Meta Llama 2 7b 基础模型和 Alpaca 指令数据集完成微调,再部署为可分享的聊天应用。
Mistral AI 发布首个 7B 参数模型 Mistral 7B,采用 Apache 2.0 许可,称其在所有标准英文与代码基准上超过现有 13B 参数以下的开源模型。
推荐理由:Mistral AI 借首款开源模型发布同时交代了开源路线与商业部署计划,可看清其早期定位。
Mistral AI 发布 7.3B 参数的 Mistral 7B,称其在所有基准上超过 Llama 2 13B,并在多项基准上超过 Llama 1 34B,采用 Apache 2.0 许可可无限制使用。
推荐理由:Mistral 7B 以 7.3B 参数在多项基准上超过 Llama 2 13B,并采用 Apache 2.0 开源,读者可据此判断小模型的能力边界与部署成本。
Hugging Face 对 Llama 2 在 Amazon SageMaker 上的 60 种部署配置进行了基准测试,覆盖 7B、13B、70B 三种规模、四种 EC2 实例(含 NVIDIA A10G 与 A100 40GB)及 1/5/10/20 并发请求,并对比了 GPTQ 4-bit 量化效果。
OpenAI 发布 GPT-4V(ision) 系统卡,介绍该多模态模型的能力与安全评估情况。原文正文未能抓取,仅标题可用。
OpenAI 宣布 ChatGPT 新增看、听、说能力,可处理图像与语音输入并语音回复。
Hugging Face 为 PRO 用户推出 Inference 服务,提供 Meta Llama 3 Instruct、Mixtral 8x7B Instruct、Zephyr 7B β、Code Llama 等精选模型的专属 API 端点,由 text-generation-inference 驱动,并提升免费 Inference API 的速率限制。
OpenAI 宣布公开招募 Red Teaming Network 成员,邀请各领域专家参与,以提升其模型的安全性。
Rocket Money 用 Hugging Face Inference API 托管其基于 BERT 家族、覆盖 4000+ 类别的交易分类模型,替代原有正则系统,该系统每月处理超 1 亿笔交易且负载波动大。经过三个月评估和模拟峰值负载测试后,Rocket Money 放弃 AWS Sagemaker 与自建方案,选择 Hugging Face 托管模型。
Hugging Face 博客发布 3D Gaussian Splatting 入门解读,介绍这种从少量图像学习真实感场景并实时渲染的栅格化技术。文章拆解其完整流程:先用 COLMAP 等 Structure from Motion 方法估计点云,再把每个点转为高斯并训练,训练采用随机梯度下降配合自动加密与剪枝,最后通过可微高斯栅格化投影、按深度排序并逐像素混合。
Hugging Face 推出目标检测排行榜(Object Detection Leaderboard),对 Hub 上的目标检测模型按指标进行排名。该榜单基于 IoU、Average Precision(AP)和 Average Recall(AR)等指标评估模型,并详解了这些指标的计算方法及评估中可能出现的分歧与陷阱,帮助开发者挑选适合自身应用的开源模型。
Hugging Face 发布博客,梳理 LLM 生产部署的三大优化方向:8-bit 和 4-bit 低精度推理、Flash Attention 以及 Alibi、Rotary embeddings、MQA、GQA 等架构改进。
OpenAI 宣布在爱尔兰都柏林设立办公室,以扩大其在欧洲的业务布局。
Hugging Face 发布教程,介绍如何用 PyTorch FSDP 结合 Transformers、Accelerate 和 TRL 微调 Llama 2 70B,并给出在 2 节点、每节点 8 张 80GB A100 上的配置。
Hugging Face 发布 Würstchen 文本条件扩散模型,通过 Stage A 的 VQGAN 与 Stage B 的 Diffusion Autoencoder 两级压缩实现 42x 空间压缩,Stage C 在压缩潜空间中训练。
推荐理由:原文给出 42x 空间压缩与训练成本对比,读者可据此判断高效扩散模型在显存与算力上的取舍。
Hugging Face Transformers 目前原生支持 bitsandbytes 和 auto-gptq 两种量化方案,前者无需校准数据即可开箱量化任意含 torch.nn.Linear 的模型,后者文本生成速度更快且支持 2-bit 量化。
Hugging Face 发布企业级代码助手 SafeCoder,基于 155 亿参数的 StarCoder 开源模型,支持 80 多种编程语言和 8192 token 上下文窗口。SafeCoder 提供闭源服务所缺乏的透明度、定制化、IT 灵活性和隐私保护,支持本地部署和完全离线运行,不会收集任何遥测数据。
Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,在 diffusers 中为 Stable Diffusion XL 加入 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件的预训练 checkpoint。
推荐理由:对比 ControlNet 的参数与显存占用,并给出 diffusers 中的调用方式,便于评估可控生成方案的取舍。
OpenAI 宣布首届开发者大会将于 11 月 6 日在旧金山举办,现场参会开发者注册将在未来几周开放,全球开发者均可观看主题演讲直播。
TII 发布 Falcon 180B 并上线 Hugging Face,模型有 1800 亿参数,在 3.5 万亿 token 的 RefinedWeb 数据上预训练,是当时最大的公开可用语言模型。
推荐理由:原文给出 Falcon 180B 的参数量、训练数据与评测对比,可据此判断开源大模型当时的规模上限。
Fetch 在 AWS 上使用 Hugging Face 与 Amazon SageMaker 优化其 ML 流水线,将最慢扫描的延迟降低 50%,文档理解模型准确率提升 200%。该公司在 12 个月内构建、训练并部署了超过五个 ML 模型,每周处理超 8000 万张收据,并于 2022 年底上线新版移动应用与 ML 流水线。
OpenAI 发布面向教师的 ChatGPT 课堂使用指南,涵盖推荐提示词、ChatGPT 工作原理与局限、AI 检测工具的有效性以及偏见问题。
Hugging Face 在 🧨 Diffusers 库中优化 AudioLDM 2 文本到音频模型,通过半精度、flash attention、编译及调度器选择等手段,将推理时间缩短超 10 倍,10 秒音频样本生成从 30 秒以上降至 1 秒。AudioLDM 2 提供 1.1B 和 1.5B 三种 checkpoint,可生成音效、人声和音乐。
OpenAI 发布 ChatGPT Enterprise,主打企业级安全与隐私,并称其为迄今最强的 ChatGPT 版本。
推荐理由:OpenAI 官方发布面向企业的 ChatGPT 版本,读者可据此了解其安全隐私定位与能力版本变化。
Meta 发布 Code Llama 系列代码模型,包含 7B、13B、34B 三个参数规模,基于 Llama 2 初始化并用 5000 亿 token 代码数据训练,采用与 Llama 2 相同的社区许可并允许商用。
推荐理由:Meta 发布 Code Llama 系列并接入 Hugging Face 生态,读者可了解其参数规模、上下文窗口与多语言基准表现。
OpenAI 与 Scale 达成合作,企业客户可借助 Scale 的 AI 专业能力微调 OpenAI 最先进的模型。该合作面向有模型定制需求的企业客户。
Hugging Face 把 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法将模型量化为 8、4、3 甚至 2-bit 精度运行,4-bit 量化精度损失可忽略,小批量下推理速度与 fp16 基线相当。
推荐理由:Hugging Face 官方说明 GPTQ 量化如何接入 Transformers 生态,读者可据此判断低比特部署的可行路径与限制。
OpenAI 宣布开发者现在可以用自己的数据微调 GPT-3.5 Turbo,以适配各自的用例,同时更新了 API。原文仅给出这一句说明,未披露微调价格、可用范围或具体 API 变更细节。
推荐理由:OpenAI 开放 GPT-3.5 Turbo 微调,开发者可用自有数据定制模型,是当时最受关注的 API 能力变化。
Hugging Face 发布 SafeCoder,一款面向企业的自托管代码助手解决方案,基于 StarCoder 系列代码大模型,代码在训练和推理阶段都不离开客户自有 VPC。
Hugging Face 发布开源视觉语言模型 IDEFICS,基于 DeepMind 未公开的 Flamingo 复现,仅使用公开数据和模型(LLaMA v1 与 OpenCLIP),提供 9B 和 80B 两个参数规模,各有基础版和指令微调版。
推荐理由:IDEFICS 用公开数据和模型复现了未开源的 Flamingo,读者可据此了解开源多模态模型当时的能力边界与训练数据构成。
OpenAI 收购了 Global Illumination,该公司整个团队已加入 OpenAI。
OpenAI 将 GPT-4 用于内容政策制定和内容审核决策,可实现更一致的标注、更快的政策优化反馈循环,并减少人工审核员的参与。
Hugging Face Hub 已上线 AWS Marketplace,用户可通过 AWS 账户订阅并支付 Hugging Face 的使用费用。订阅后,Inference Endpoints、Spaces 硬件升级和 AutoTrain 等服务的组织用量费用将自动计入 AWS 账单,价格与 Hugging Face 公开定价一致。连接需使用具备 admin 角色的组织账户,暂不支持个人账户。
Hugging Face 发布实战教程,演示如何用 Transformers、Optimum 和 Accelerate 三个库优化 Suno AI 的文本转语音模型 Bark。教程以 suno/bark-small 为例,基准测试显示未优化时单次生成耗时 9.38 秒、峰值显存占用 1.91 GB,并介绍了三种优化手段及其对比结果。
Hugging Face 博客演示如何用开源模型服务框架 BentoML 部署 DeepFloyd IF 文生图模型。DeepFloyd IF 直接在像素空间工作,由冻结文本编码器 T5-XXL-1.1 和三个级联像素扩散模块组成,分三阶段将 64x64 px 图像逐步放大至 1024x1024 px。
Hugging Face 在 TRL 库中上线 Direct Preference Optimization(DPO)方法,并演示如何用它在 stack-exchange 偏好数据上微调 Llama v2 7B 模型。
推荐理由:Hugging Face 官方给出 DPO 在 TRL 中的完整训练流程与代码,读者可据此在自有偏好数据上复现对齐训练。
Hugging Face 发布 swift-transformers Swift 包及配套工具,让开发者在 Apple 设备上用 Core ML 本地运行 Llama 2、Falcon 等模型。
推荐理由:Hugging Face 放出在 Apple 设备本地跑 Llama 2 的 Swift 工具链,读者可据此了解端侧 LLM 的转换与优化路径。
Hugging Face 发布教程,介绍如何通过 Inference Endpoints 的自定义 handler 部署音乐生成模型 MusicGen。用户需复制 facebook/musicgen-large 仓库,添加 handler.py 和 requirements.txt,即可创建端点,16 GB RAM 实例即可运行。