Hugging Face 详解 AI 水印:工具与技术
Hugging Face 发布 AI 水印入门指南,介绍在内容生成时嵌入水印与生成后添加水印两种主要方法,前者需访问模型但更稳健,后者可适用于闭源模型。文章还梳理了 Glaze、Photoguard、Nightshade、Fawkes 等图像防护工具,以及 Truepic 基于 C2PA 标准的内容签名方案,并讨论了水印开放与闭源的利弊。
Hugging Face 发布 AI 水印入门指南,介绍在内容生成时嵌入水印与生成后添加水印两种主要方法,前者需访问模型但更稳健,后者可适用于闭源模型。文章还梳理了 Glaze、Photoguard、Nightshade、Fawkes 等图像防护工具,以及 Truepic 基于 C2PA 标准的内容签名方案,并讨论了水印开放与闭源的利弊。
SegMind 发布 SegMoE 框架,可从零构建混合专家(MoE)扩散模型,并已集成 Hugging Face diffusers。同时发布 SegMoE-2x1、SegMoE-4x2 和 SegMoE-SD4x2 三个模型,采用 Apache 2.0 许可,并提供 GitHub 仓库和 segmoe 包用于自建 MoE 模型。
推荐理由:原文给出了从零构建 MoE 扩散模型的完整流程与显存门槛,读者可据此判断自己能否复现。
Hugging Face 发布经 Olive 优化的 SD Turbo 和 SDXL Turbo 模型,在 NVIDIA GPU 上通过 ONNX Runtime CUDA 与 TensorRT 执行提供程序加速推理,吞吐量最高较 PyTorch 提升 229%(SDXL Turbo)和 120%(SD Turbo)。
Hugging Face 发布教程,介绍如何用 ComfyUI-to-Python-Extension 把 ComfyUI 工作流导出为纯 Python 脚本,再用 Gradio 封装成应用并部署到 Hugging Face Spaces 的 ZeroGPU 上免费运行。
推荐理由:教程给出把 ComfyUI 工作流导出为 Python、封装 Gradio 并部署到 ZeroGPU 的完整步骤,可迁移到自己的工作流。
Hugging Face 发布 aMUSEd,一个基于掩码图像建模(MIM)的非扩散文生图模型,是对 Google MUSE 的开源复现,采用宽松许可证并以研究预览形式发布。
Hugging Face 发布 SDXL Dreambooth LoRA 高级训练脚本,将 Pivotal Tuning 与 Prodigy 优化器结合,并给出配套参数配置。
推荐理由:汇总 SDXL Dreambooth LoRA 微调的社区实践,含 Pivotal Tuning 与 Prodigy 优化器的参数配置和对比实验。
Hugging Face 发布 Latent Consistency LoRA,通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。
推荐理由:原文给出了 LCM LoRA 的推理代码、速度对比表和已发布权重,读者可据此判断少步生成的可用性。
Hugging Face 在 A100 40GB 上实测了 SDXL 的多种推理优化,未优化管线占用 28GB 显存、耗时 72.2 秒,改用 fp16 后降至 21.7GB 和 14.8 秒。
推荐理由:Hugging Face 官方给出 SDXL 在 Diffusers 中的显存与延迟实测数据,可直接对照选择优化组合。
OpenAI 宣布 DALL·E 3 现已在 ChatGPT Plus 和 Enterprise 中可用。官方表示为更广泛发布开发了一套安全缓解方案,并同步分享了内容溯源研究方面的进展。
推荐理由:OpenAI 官方宣布 DALL·E 3 在 ChatGPT Plus 和 Enterprise 上线,并说明为扩大发布准备了安全缓解措施。
OpenAI 发布 DALL·E 3 系统卡,用于说明该图像生成模型在安全与风险方面的评估情况。原文正文未能抓取,仅标题可用。
Hugging Face Diffusers 现已支持使用 JAX 在 Cloud TPU 上部署 SDXL,实现高性能、低成本的推理。演示运行在多个 TPU v5e-4 实例上,约 4 秒生成四张 1024×1024 图像,其中实际生成时间约 2.3 秒。
Hugging Face 在 trl 库中集成 DDPOTrainer,可用 DDPO(Denoising Diffusion Policy Optimization)对 Stable Diffusion 做强化学习微调。
Hugging Face 博客发布 3D Gaussian Splatting 入门解读,介绍这种从少量图像学习真实感场景并实时渲染的栅格化技术。文章拆解其完整流程:先用 COLMAP 等 Structure from Motion 方法估计点云,再把每个点转为高斯并训练,训练采用随机梯度下降配合自动加密与剪枝,最后通过可微高斯栅格化投影、按深度排序并逐像素混合。
Hugging Face 发布 Würstchen 文本条件扩散模型,通过 Stage A 的 VQGAN 与 Stage B 的 Diffusion Autoencoder 两级压缩实现 42x 空间压缩,Stage C 在压缩潜空间中训练。
推荐理由:原文给出 42x 空间压缩与训练成本对比,读者可据此判断高效扩散模型在显存与算力上的取舍。
Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,在 diffusers 中为 Stable Diffusion XL 加入 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件的预训练 checkpoint。
推荐理由:对比 ControlNet 的参数与显存占用,并给出 diffusers 中的调用方式,便于评估可控生成方案的取舍。
Hugging Face 博客演示如何用开源模型服务框架 BentoML 部署 DeepFloyd IF 文生图模型。DeepFloyd IF 直接在像素空间工作,由冻结文本编码器 T5-XXL-1.1 和三个级联像素扩散模块组成,分三阶段将 64x64 px 图像逐步放大至 1024x1024 px。
Hugging Face 发布教程,演示如何用 OpenAI 开源扩散模型 Shap-E 从文本生成 3D 模型,再经 Blender 减面、Dream Textures 生成无缝贴图、UV 展开后导出 FBX 并导入 Unity,做出 PS1 风格低精度 3D 资产。
Segmind 开源了压缩版 Stable Diffusion 模型 SD-Small 和 SD-Tiny 的权重与蒸馏训练代码,两者参数量分别比基础模型少 35% 和 55%,同时保持接近的图像保真度。
推荐理由:Segmind 开源了 SD-Small 与 SD-Tiny 的蒸馏代码和权重,并给出参数量、加速比与使用方式,便于复现和二次微调。
Hugging Face 的 Diffusers 库迎来一周年,已从文生图工具箱扩展出视频、3D 与图像编辑能力。新增支持 DeepFloyd IF、Stability AI SDXL、OpenAI Shap-E 文生 3D,以及 VideoFusion、Text2Video-Zero 文生视频管线。
Hugging Face 发布《伦理与社会通讯》第 4 期,聚焦文本到图像模型的偏见问题,指出训练数据、预训练数据过滤、推理、模型潜在空间及事后过滤等环节均可能引入偏见。
Hugging Face 博客介绍如何将 InstructPix2Pix 的训练策略与 FLAN 的指令模板思路结合,对 Stable Diffusion 做指令微调,使其按输入图像加指令完成卡通化、去雨等图像翻译与底层图像处理任务。
Hugging Face 博客介绍如何在免费版 Google Colab(13GB CPU 内存、15GB T4 显存)上用 diffusers 运行 DeepFloyd 的 IF 文生图模型。
推荐理由:原文给出在免费 Colab 上分阶段加载 IF 的完整代码与显存取舍,可迁移到其他大模型的低显存部署。
Hugging Face 展示了在 Intel Sapphire Rapids CPU 上加速 Stable Diffusion 推理的多种技术。
Hugging Face 发布教程,讲解如何用 diffusers 训练 ControlNet,并以人脸姿态为例走完条件设计、数据集构建和模型训练三步。数据集基于微软 FaceSynthetics 的 100K 合成人脸,用 SPIGA 提取 iBUG 68 点关键点生成条件图,再用 BLIP 生成 caption。
推荐理由:Hugging Face 官方复盘了从条件设计、数据集构建到 diffusers 训练脚本的完整 ControlNet 训练流程,并给出不同显存下的参数配置。
Hugging Face 在 Diffusers 中集成 ControlNet,通过 StableDiffusionControlNetPipeline 支持 canny 边缘、OpenPose 姿态、深度图、分割图等多种空间条件控制图像生成。
推荐理由:Diffusers 官方给出 ControlNet 的完整接入方式与多种条件控制示例,可据此判断显存与速度开销。
Hugging Face 为 Mac 推出原生应用 🧨Diffusers 1.1,基于 Core ML 运行 Stable Diffusion 等文生图模型,生成速度最高提升至 2 倍。该版本会自动根据设备选择 GPU 或神经引擎(ANE)加速,并新增模型下载指示、复用 seed 等功能,已在 Mac App Store 上线且完全开源。
Hugging Face 公布其计算机视觉生态进展:Hub 上已支持 8 项核心视觉任务、超过 3000 个模型和 100 多个数据集,涵盖图像分类、分割、目标检测、深度估计等,并兼容 ViT、Swin、DETR 及 ConvNeXt、ResNet 等架构。
Hugging Face 博客"AI for Game Development"系列第 4 篇讲解如何用 Stable Diffusion 的 Image2Image 生成 2D 游戏资产,并以农场游戏的玉米和镰刀图标为例演示完整流程。
Hugging Face 在 diffusers 中正式支持 LoRA 微调 Stable Diffusion,训练脚本最低只需 11 GB 显存,产出的新增权重文件约 3 MB,比原 UNet 小约一千倍。
推荐理由:Hugging Face 官方给出 LoRA 微调 Stable Diffusion 的完整流程与显存、权重体积数据,可直接照做。
Hugging Face 博客"AI for Game Development"系列第 3 篇指出,text-to-3D 目前还无法实际用于游戏开发,生成的 mesh 无法直接用于游戏,仍需大量人工后处理。
Mask2Former 和 OneFormer 两款统一图像分割模型现已集成到 Hugging Face 开源库 transformers 中。Mask2Former 用同一架构解决实例、语义和全景分割,但需分任务训练;OneFormer 仅在全景数据上训练一次即可在三个任务上达到 SOTA,代价是额外的文本编码器带来更高延迟。作者已发布 30 个基于不同数据集训练的 checkpoint。
Hugging Face 发布教程,介绍如何用 Transformers 和 Datasets 库构建图像相似度系统,实现反向图像搜索等信息检索场景。方案采用 ViT 模型(nateraw/vit-base-beans)提取图像嵌入向量,再用余弦相似度匹配候选图像,示例使用 Beans 数据集,也可替换为 Swin Transformer、ConvNeXT、RegNet 等视觉模型。
Hugging Face 博客推出"AI for Game Development"系列教程,演示如何在 5 天内用 AI 工具做出一个完整农场游戏。
Hugging Face 发布指南,介绍如何通过 transformers 使用零样本图像分割模型 CLIPSeg。该模型在冻结的 CLIP 之上训练 Transformer 解码器,可生成粗略分割掩码,用于机器人感知、图像修复等任务,并支持文本或图像作为提示进行视觉提示。CLIPSeg 使用 352 x 352 像素图像,输出分辨率较低,如需更精细结果可在 Segments.ai 上微调优化。
OpenAI 发布 Point-E,一个可根据复杂提示词生成 3D 点云的系统。
Hugging Face 联合 Apple 工程师把 Stable Diffusion 权重转换为 Core ML 格式并上传到 Hub,可在 Apple Silicon 的 CPU、GPU 和神经引擎上运行。
推荐理由:原文给出在 Apple Silicon 上用 Core ML 跑 Stable Diffusion 的完整流程与性能参考,可迁移到本地部署实践。
中国科学技术大学与微软提出 VQ-Diffusion,一种在量化隐空间上执行加噪与去噪的条件扩散模型,隐空间由离散向量集合构成。该模型使用冻结的 VQ-VAE 编码图像,并以编码器-解码器 Transformer 近似反向过程,一次前向即可预测全部未加噪隐变量的分布。
Hugging Face 与 Jonathan Whitaker 合作的扩散模型课程将于 11 月 28 日发布,配套社区直播活动定于 11 月 30 日举行。
Hugging Face 用 🧨 Diffusers 的 Dreambooth 训练脚本做了大量实验,分析不同超参数对微调 Stable Diffusion 的影响并给出推荐设置。
推荐理由:基于大量实验给出 Dreambooth 微调 Stable Diffusion 的超参数建议,可迁移到自己的训练流程。
OpenAI 宣布 DALL·E API 进入公开测试阶段,开发者从即日起可以基于该 API 构建应用。
推荐理由:OpenAI 官方开放 DALL·E API 公测,开发者可据此判断图像生成能力接入自家应用的门槛变化。