Hugging Face 发布 LCM LoRA,SDXL 可在 4 步内出图
Hugging Face 发布 Latent Consistency LoRA,通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。
推荐理由:原文给出了 LCM LoRA 的推理代码、速度对比表和已发布权重,读者可据此判断少步生成的可用性。
技术方向
AI 画图的最前线:文生图模型迭代、图像编辑能力与创作工具生态的全部动态。
46 条精选近 30 天 1 条共收录 104 条
Hugging Face 发布 Latent Consistency LoRA,通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。
推荐理由:原文给出了 LCM LoRA 的推理代码、速度对比表和已发布权重,读者可据此判断少步生成的可用性。
Hugging Face 在 A100 40GB 上实测了 SDXL 的多种推理优化,未优化管线占用 28GB 显存、耗时 72.2 秒,改用 fp16 后降至 21.7GB 和 14.8 秒。
推荐理由:Hugging Face 官方给出 SDXL 在 Diffusers 中的显存与延迟实测数据,可直接对照选择优化组合。
OpenAI 宣布 DALL·E 3 现已在 ChatGPT Plus 和 Enterprise 中可用。官方表示为更广泛发布开发了一套安全缓解方案,并同步分享了内容溯源研究方面的进展。
推荐理由:OpenAI 官方宣布 DALL·E 3 在 ChatGPT Plus 和 Enterprise 上线,并说明为扩大发布准备了安全缓解措施。
OpenAI 发布 DALL·E 3 系统卡,用于说明该图像生成模型在安全与风险方面的评估情况。原文正文未能抓取,仅标题可用。
Hugging Face 发布 Würstchen 文本条件扩散模型,通过 Stage A 的 VQGAN 与 Stage B 的 Diffusion Autoencoder 两级压缩实现 42x 空间压缩,Stage C 在压缩潜空间中训练。
推荐理由:原文给出 42x 空间压缩与训练成本对比,读者可据此判断高效扩散模型在显存与算力上的取舍。
Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,在 diffusers 中为 Stable Diffusion XL 加入 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件的预训练 checkpoint。
推荐理由:对比 ControlNet 的参数与显存占用,并给出 diffusers 中的调用方式,便于评估可控生成方案的取舍。
Segmind 开源了压缩版 Stable Diffusion 模型 SD-Small 和 SD-Tiny 的权重与蒸馏训练代码,两者参数量分别比基础模型少 35% 和 55%,同时保持接近的图像保真度。
推荐理由:Segmind 开源了 SD-Small 与 SD-Tiny 的蒸馏代码和权重,并给出参数量、加速比与使用方式,便于复现和二次微调。
Hugging Face 博客介绍如何在免费版 Google Colab(13GB CPU 内存、15GB T4 显存)上用 diffusers 运行 DeepFloyd 的 IF 文生图模型。
推荐理由:原文给出在免费 Colab 上分阶段加载 IF 的完整代码与显存取舍,可迁移到其他大模型的低显存部署。
Hugging Face 发布教程,讲解如何用 diffusers 训练 ControlNet,并以人脸姿态为例走完条件设计、数据集构建和模型训练三步。数据集基于微软 FaceSynthetics 的 100K 合成人脸,用 SPIGA 提取 iBUG 68 点关键点生成条件图,再用 BLIP 生成 caption。
推荐理由:Hugging Face 官方复盘了从条件设计、数据集构建到 diffusers 训练脚本的完整 ControlNet 训练流程,并给出不同显存下的参数配置。
Hugging Face 在 Diffusers 中集成 ControlNet,通过 StableDiffusionControlNetPipeline 支持 canny 边缘、OpenPose 姿态、深度图、分割图等多种空间条件控制图像生成。
推荐理由:Diffusers 官方给出 ControlNet 的完整接入方式与多种条件控制示例,可据此判断显存与速度开销。
Hugging Face 在 diffusers 中正式支持 LoRA 微调 Stable Diffusion,训练脚本最低只需 11 GB 显存,产出的新增权重文件约 3 MB,比原 UNet 小约一千倍。
推荐理由:Hugging Face 官方给出 LoRA 微调 Stable Diffusion 的完整流程与显存、权重体积数据,可直接照做。
OpenAI 发布 Point-E,一个可根据复杂提示词生成 3D 点云的系统。
Hugging Face 联合 Apple 工程师把 Stable Diffusion 权重转换为 Core ML 格式并上传到 Hub,可在 Apple Silicon 的 CPU、GPU 和神经引擎上运行。
推荐理由:原文给出在 Apple Silicon 上用 Core ML 跑 Stable Diffusion 的完整流程与性能参考,可迁移到本地部署实践。
Hugging Face 用 🧨 Diffusers 的 Dreambooth 训练脚本做了大量实验,分析不同超参数对微调 Stable Diffusion 的影响并给出推荐设置。
推荐理由:基于大量实验给出 Dreambooth 微调 Stable Diffusion 的超参数建议,可迁移到自己的训练流程。
OpenAI 宣布 DALL·E API 进入公开测试阶段,开发者从即日起可以基于该 API 构建应用。
推荐理由:OpenAI 官方开放 DALL·E API 公测,开发者可据此判断图像生成能力接入自家应用的门槛变化。
Hugging Face Diffusers 自 0.5.1 版起支持 Flax,可在 Colab、Kaggle 或 Google Cloud 的 TPU 上快速推理 Stable Diffusion。
推荐理由:Hugging Face 官方给出在 TPU 上用 JAX/Flax 跑 Stable Diffusion 的完整步骤与并行原理,可迁移到多设备推理。
OpenAI 宣布 DALL·E 不再需要等待名单,新用户可以直接开始创作。OpenAI 表示,部署中积累的经验以及对安全系统的改进使更广泛的开放成为可能。
推荐理由:OpenAI 取消 DALL·E 等待名单,读者可了解其安全系统改进后开放范围的变化。
Hugging Face 发布 diffusers 0.3,为扩散模型工具箱新增图生图、文本反转、实验性修复(inpainting)等流水线,并加入面向小显存的优化,Stable Diffusion 显存占用可降至 3.2GB,代价是约 10% 的速度损失。
推荐理由:diffusers 0.3 集中补齐图生图、文本反转、修复与低显存优化,可据此判断扩散模型工具链的成熟度。
OpenAI 为 DALL·E 推出 outpainting 功能,可生成任意尺寸的图像,用于扩展画面并讲述更完整的故事。
推荐理由:OpenAI 为 DALL·E 增加 outpainting 能力,读者可了解图像生成从单张出图扩展到任意尺寸续画。
Hugging Face 发布教程,介绍如何用 diffusers 库运行 Stable Diffusion,并解释其潜空间扩散模型的工作原理。
推荐理由:Hugging Face 官方给出 Stable Diffusion 在 diffusers 中的完整用法与原理拆解,可据此理解潜空间扩散的组件分工。