如何在 JAX / Flax 上运行 Stable Diffusion
Hugging Face Diffusers 自 0.5.1 版起支持 Flax,可在 Colab、Kaggle 或 Google Cloud 的 TPU 上快速推理 Stable Diffusion。
推荐理由:Hugging Face 官方给出在 TPU 上用 JAX/Flax 跑 Stable Diffusion 的完整步骤与并行原理,可迁移到多设备推理。
Hugging Face Diffusers 自 0.5.1 版起支持 Flax,可在 Colab、Kaggle 或 Google Cloud 的 TPU 上快速推理 Stable Diffusion。
推荐理由:Hugging Face 官方给出在 TPU 上用 JAX/Flax 跑 Stable Diffusion 的完整步骤与并行原理,可迁移到多设备推理。
rinna 推出日语专用文生图模型 Japanese Stable Diffusion,通过在约 1 亿张日语标注图像上微调 Stable Diffusion 实现,可理解日语特有词汇、拟声词与专有名词。
OpenAI 宣布 DALL·E 不再需要等待名单,新用户可以直接开始创作。OpenAI 表示,部署中积累的经验以及对安全系统的改进使更广泛的开放成为可能。
推荐理由:OpenAI 取消 DALL·E 等待名单,读者可了解其安全系统改进后开放范围的变化。
Hugging Face AutoTrain 新增图像分类任务,用户无需编写代码即可训练模型。上传数据后,AutoTrain 自动尝试多个模型架构,示例中最佳模型达到 84% 准确率,5 个候选模型加 500 张以内图片的训练免费。
Hugging Face 发布 diffusers 0.3,为扩散模型工具箱新增图生图、文本反转、实验性修复(inpainting)等流水线,并加入面向小显存的优化,Stable Diffusion 显存占用可降至 3.2GB,代价是约 10% 的速度损失。
推荐理由:diffusers 0.3 集中补齐图生图、文本反转、修复与低显存优化,可据此判断扩散模型工具链的成熟度。
OpenAI 为 DALL·E 推出 outpainting 功能,可生成任意尺寸的图像,用于扩展画面并讲述更完整的故事。
推荐理由:OpenAI 为 DALL·E 增加 outpainting 能力,读者可了解图像生成从单张出图扩展到任意尺寸续画。
Hugging Face 发布教程,介绍如何用 diffusers 库运行 Stable Diffusion,并解释其潜空间扩散模型的工作原理。
推荐理由:Hugging Face 官方给出 Stable Diffusion 在 diffusers 中的完整用法与原理拆解,可据此理解潜空间扩散的组件分工。
Hugging Face 发布教程,演示如何用 Optimum Graphcore 库在 Graphcore IPU 上微调预训练 Vision Transformer(ViT)模型。
Hugging Face 与外部贡献者为 Transformers 加入了 Vision Transformer、Masked Autoencoders、RegNet、ConvNeXt 等 TensorFlow 视觉模型,本文演示如何用 TensorFlow Serving 在本地部署 ViT 图像分类模型,以 REST 或 gRPC 端点暴露服务。
OpenAI 宣布 DALL·E 进入测试版,将在未来几周从候补名单中邀请 100 万人使用。用户可用每月重置的免费额度生成图像,也可按 115 次生成 15 美元的价格购买额外额度。
推荐理由:官方公布 DALL·E 测试版开放节奏与免费额度、付费增量,可据此了解早期图像生成产品的定价方式。
OpenAI 为 DALL·E 2 部署了一项新技术,使其生成的人物图像能更准确地反映世界人口的多样性,以减少偏见并提升安全性。
OpenAI 公布 DALL·E 2 研究预览进展,来自 118 个以上国家的 3000 多名艺术家已将 DALL·E 纳入自己的创作流程。OpenAI 表示,早期访问组的艺术家帮助发现了 DALL·E 的新用途,并在其决定 DALL·E 功能时提供了关键意见。
推荐理由:官方披露 DALL·E 2 研究预览的艺术家使用规模,可了解早期创作者如何把它接入创作流程。
OpenAI 为向大众开放 DALL·E 2,在预训练阶段采取多种缓解措施以降低强大图像生成模型带来的风险。这些防护机制用于防止生成图像违反其内容政策。
Hugging Face 博客发布《The Annotated Diffusion Model》,基于 Ho 等人 2020 年的 DDPM 论文和 Phil Wang 的实现,用 PyTorch 逐步实现去噪扩散概率模型。
推荐理由:以 PyTorch 逐步实现 DDPM 的完整教程,适合想从代码层面理解扩散模型原理的读者。
OpenAI 更新 DALL·E 2 研究预览进展,早期用户迄今已生成超过 300 万张图像,并帮助改进了安全流程。OpenAI 表示将开始每周从候补名单中新增最多 1000 名用户。
推荐理由:官方披露 DALL·E 2 预览期已生成超 300 万张图像,并给出每周新增 1000 名候补用户的节奏。
Hugging Face 发布教程,演示如何用自建人行道数据集 segments/sidewalk-semantic 微调 SegFormer 语义分割模型,用于披萨配送机器人识别可行驶区域与障碍物。
Hugging Face 的 🤗 datasets 现已支持图像特征类型,可结合 sentence_transformers 与 faiss 为图像数据集添加相似度索引,实现图像搜索。文中以英国图书馆数字化书籍插图数据集为例,通过 ImageFolder 加载器直接读取含 image 和 label 特征的 10000 行数据,并演示了提取图像文件名等元数据的方法。
Hugging Face 发布教程,演示如何用 🤗 datasets 加载 beans 图像分类数据集,并借助 🤗 transformers 微调预训练的 google/vit-base-patch16-224-in21k 模型。ViT 由 Google Brain 团队于 2021 年 6 月提出,将图像切分为子图块并嵌入为 token 序列后送入 Transformer 训练。
OpenAI 训练了一个名为 DALL·E 的神经网络,可根据自然语言描述生成图像,覆盖自然语言可表达的多种概念。
推荐理由:OpenAI 官方公布 DALL·E 这一从文本生成图像的神经网络,可据此了解文生图方向的早期起点。
OpenAI 发现,与在语言上训练的大 Transformer 模型一样,在像素序列上训练的同一模型也能生成连贯的图像补全和样本。研究通过建立样本质量与图像分类准确率之间的相关性,表明其最佳生成模型在无监督设定下所含特征可与顶级卷积网络竞争。
推荐理由:OpenAI 用同一套 Transformer 架构处理像素序列,并给出生成质量与分类精度相关的证据,可看早期统一建模思路。
OpenAI 推出可逆生成模型 Glow,采用可逆 1x1 卷积,简化了此前可逆生成模型的架构。该模型能生成逼真的高分辨率图像,支持高效采样,并可发现用于操控数据属性的特征。OpenAI 同步开源模型代码并上线在线可视化工具。
OpenAI 造出能从不同尺度和视角稳定欺骗神经网络分类器的对抗图像,直接挑战了上周"自动驾驶汽车因多尺度、多角度取像而难以被恶意欺骗"的说法。