跳到正文
6月12日周三
6月6日周四
5月16日周四
  1. OpenAI News20

    Canva 打造 AI 驱动的 Magic Studio

    Canva 推出 AI 驱动的 Magic Studio,为其月活超 1.75 亿的视觉传播平台加入 AI 创作能力。该平台支持制作演示文稿、视频、文档、网站和社交媒体图形,借助易用界面、丰富素材库和提效工具,让缺乏设计训练的知识工作者也能创作出视觉出色的内容。

2月26日周一
  1. Hugging Face Blog40

    Hugging Face 详解 AI 水印:工具与技术

    Hugging Face 发布 AI 水印入门指南,介绍在内容生成时嵌入水印与生成后添加水印两种主要方法,前者需访问模型但更稳健,后者可适用于闭源模型。文章还梳理了 Glaze、Photoguard、Nightshade、Fawkes 等图像防护工具,以及 Truepic 基于 C2PA 标准的内容签名方案,并讨论了水印开放与闭源的利弊。

2月3日周六
  1. Hugging Face Blog62

    SegMind 发布 SegMoE 扩散模型混合专家框架

    SegMind 发布 SegMoE 框架,可从零构建混合专家(MoE)扩散模型,并已集成 Hugging Face diffusers。同时发布 SegMoE-2x1、SegMoE-4x2 和 SegMoE-SD4x2 三个模型,采用 Apache 2.0 许可,并提供 GitHub 仓库和 segmoe 包用于自建 MoE 模型。

    推荐理由:原文给出了从零构建 MoE 扩散模型的完整流程与显存门槛,读者可据此判断自己能否复现。

1月15日周一
1月14日周日
  1. Hugging Face Blog62

    如何在 Hugging Face Spaces 上用 Gradio 免费运行 ComfyUI 工作流

    Hugging Face 发布教程,介绍如何用 ComfyUI-to-Python-Extension 把 ComfyUI 工作流导出为纯 Python 脚本,再用 Gradio 封装成应用并部署到 Hugging Face Spaces 的 ZeroGPU 上免费运行。

    推荐理由:教程给出把 ComfyUI 工作流导出为 Python、封装 Gradio 并部署到 ZeroGPU 的完整步骤,可迁移到自己的工作流。

1月4日周四
1月2日周二
11月9日周四
10月24日周二
10月19日周四
  1. OpenAI News70

    DALL·E 3 在 ChatGPT Plus 和 Enterprise 上线

    OpenAI 宣布 DALL·E 3 现已在 ChatGPT Plus 和 Enterprise 中可用。官方表示为更广泛发布开发了一套安全缓解方案,并同步分享了内容溯源研究方面的进展。

    推荐理由:OpenAI 官方宣布 DALL·E 3 在 ChatGPT Plus 和 Enterprise 上线,并说明为扩大发布准备了安全缓解措施。

10月3日周二
9月29日周五
9月18日周一
  1. Hugging Face Blog52

    3D Gaussian Splatting 入门:原理、训练流程与图形学前景

    Hugging Face 博客发布 3D Gaussian Splatting 入门解读,介绍这种从少量图像学习真实感场景并实时渲染的栅格化技术。文章拆解其完整流程:先用 COLMAP 等 Structure from Motion 方法估计点云,再把每个点转为高斯并训练,训练采用随机梯度下降配合自动加密与剪枝,最后通过可微高斯栅格化投影、按深度排序并逐像素混合。

9月13日周三
9月8日周五
  1. Hugging Face Blog62

    Hugging Face 为 SDXL 推出 T2I-Adapter 可控生成支持

    Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,在 diffusers 中为 Stable Diffusion XL 加入 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件的预训练 checkpoint。

    推荐理由:对比 ControlNet 的参数与显存占用,并给出 diffusers 中的调用方式,便于评估可控生成方案的取舍。

8月9日周三
8月1日周二
  1. Hugging Face Blog60

    Segmind 开源 SD-Small 与 SD-Tiny 知识蒸馏代码和权重

    Segmind 开源了压缩版 Stable Diffusion 模型 SD-Small 和 SD-Tiny 的权重与蒸馏训练代码,两者参数量分别比基础模型少 35% 和 55%,同时保持接近的图像保真度。

    推荐理由:Segmind 开源了 SD-Small 与 SD-Tiny 的蒸馏代码和权重,并给出参数量、加速比与使用方式,便于复现和二次微调。

7月20日周四
6月26日周一
5月23日周二
4月26日周三
3月28日周二
3月24日周五
  1. Hugging Face Blog62

    用 diffusers 训练自己的 ControlNet

    Hugging Face 发布教程,讲解如何用 diffusers 训练 ControlNet,并以人脸姿态为例走完条件设计、数据集构建和模型训练三步。数据集基于微软 FaceSynthetics 的 100K 合成人脸,用 SPIGA 提取 iBUG 68 点关键点生成条件图,再用 BLIP 生成 caption。

    推荐理由:Hugging Face 官方复盘了从条件设计、数据集构建到 diffusers 训练脚本的完整 ControlNet 训练流程,并给出不同显存下的参数配置。

3月3日周五
2月24日周五
  1. Hugging Face Blog42

    Hugging Face 发布 Swift 🧨Diffusers 1.1:Mac 原生 Stable Diffusion 应用提速至 2 倍

    Hugging Face 为 Mac 推出原生应用 🧨Diffusers 1.1,基于 Core ML 运行 Stable Diffusion 等文生图模型,生成速度最高提升至 2 倍。该版本会自动根据设备选择 GPU 或神经引擎(ANE)加速,并新增模型下载指示、复用 seed 等功能,已在 Mac App Store 上线且完全开源。

1月30日周一
1月26日周四
1月20日周五
1月19日周四
  1. Hugging Face Blog42

    Hugging Face transformers 集成 Mask2Former 与 OneFormer,统一图像分割

    Mask2Former 和 OneFormer 两款统一图像分割模型现已集成到 Hugging Face 开源库 transformers 中。Mask2Former 用同一架构解决实例、语义和全景分割,但需分任务训练;OneFormer 仅在全景数据上训练一次即可在三个任务上达到 SOTA,代价是额外的文本编码器带来更高延迟。作者已发布 30 个基于不同数据集训练的 checkpoint。

1月16日周一
  1. Hugging Face Blog38

    用 Hugging Face Datasets 和 Transformers 构建图像相似度系统

    Hugging Face 发布教程,介绍如何用 Transformers 和 Datasets 库构建图像相似度系统,实现反向图像搜索等信息检索场景。方案采用 ViT 模型(nateraw/vit-base-beans)提取图像嵌入向量,再用余弦相似度匹配候选图像,示例使用 Beans 数据集,也可替换为 Swin Transformer、ConvNeXT、RegNet 等视觉模型。

1月2日周一
12月21日周三
  1. Hugging Face Blog44

    用 CLIPSeg 实现零样本图像分割

    Hugging Face 发布指南,介绍如何通过 transformers 使用零样本图像分割模型 CLIPSeg。该模型在冻结的 CLIP 之上训练 Transformer 解码器,可生成粗略分割掩码,用于机器人感知、图像修复等任务,并支持文本或图像作为提示进行视觉提示。CLIPSeg 使用 352 x 352 像素图像,输出分辨率较低,如需更精细结果可在 Segments.ai 上微调优化。

12月16日周五
12月1日周四
11月30日周三