跳到正文
  1. OpenAI News62

    OpenAI 发布 ChatGPT Images 2.5

    OpenAI 发布 ChatGPT Images 2.5,可将想法、草图与参考照片转化为更个性化、更精致的图像,并更贴近用户原本的构想。

    推荐理由:OpenAI 官方发布 ChatGPT Images 2.5,读者可了解其在个性化图像生成上的定位与输入方式。

  1. Google DeepMind78

    Google DeepMind 发布 Nano Banana 2 Lite 与 Gemini Omni Flash

    Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型。

    推荐理由:两款新模型同时开放开发者入口,并给出延迟、单价与能力边界,便于判断多模态流水线的成本与可行性。

  1. Google Research62

    Google Photos 上线 Auto frame 功能,可事后改变照片拍摄视角

    Google Photos 的 Auto frame 新增一项基于机器学习的重构图能力,把照片理解为 3D 场景并自动调整相机位置与焦距,生成原本未拍到的内容。该方法分两步:先用内部 3D 点图估计模型重建人体与面部并估算原焦距,再用生成式潜在扩散模型填补新视角下的空洞。该功能已上线,面向含人物的照片自动处理,重构图结果作为 Auto frame 候选中的第二个版本供用户选择。

    推荐理由:Google Photos 把 3D 场景估计与生成式补全结合,读者可了解拍照后改变机位这一编辑思路的实现路径。

  1. OpenAI News67

    OpenAI 推出 ChatGPT Images 2.0

    OpenAI 发布 ChatGPT Images 2.0,改进了文字渲染、多语言支持和视觉推理能力。原文同时提到可查看 Images 2.5 的新变化。

    推荐理由:官方给出图像生成能力的三项具体改进方向,可据此判断多语言与文字渲染场景的可用性变化。

  1. Hugging Face Blog62

    TII 发布 Falcon Perception 与 Falcon OCR 模型

    阿布扎比 TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。

    推荐理由:原文给出 0.6B 早期融合模型在 SA-Co 与 PBench 上的分项对比,可据此判断单骨干架构在开放词汇感知上的取舍。

  1. Google DeepMind80

    Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image)

    Google DeepMind 发布图像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),把 Nano Banana Pro 的世界知识、推理与画质带到 Flash 速度。

    推荐理由:官方给出 Nano Banana 2 的能力清单与上线渠道,读者可据此判断 Pro 级图像能力下放到 Flash 速度后的可用范围。

  1. OpenAI News72

    OpenAI 发布 ChatGPT Images 与 GPT-Image-1.5

    OpenAI 发布 ChatGPT Images 体验和 GPT-Image-1.5,后者已在 API 中提供。官方称新版 ChatGPT Images 速度更快,并提示可查看最新的 ChatGPT Images 2.5。

    推荐理由:OpenAI 在 API 中上线 GPT-Image-1.5,并同步更新 ChatGPT 图像生成体验,可据此了解图像模型迭代方向。

  1. Hugging Face Blog62

    Diffusers 集成 FLUX.2,支持 4bit 量化加载

    Hugging Face Diffusers 宣布支持 FLUX.2,提供 Flux2Pipeline 与 Flux2Transformer2DModel,文本编码器使用 Mistral3ForConditionalGeneration。

    推荐理由:Diffusers 集成 FLUX.2 并给出 4bit 量化加载示例,读者可据此了解在消费级显存上跑该模型的路径与限制。

  1. Google DeepMind78

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像模型

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,主打高保真图像生成与编辑,已在 Google AI Studio 和 Vertex AI 以付费预览形式逐步开放。

    推荐理由:官方给出新图像模型的分辨率、文本渲染与搜索接地能力,可据此判断多模态应用的选型与成本取舍。

  2. Google DeepMind82

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像生成与编辑模型

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),这是基于 Gemini 3 Pro 的新一代图像生成与编辑模型,可生成更准确、文本更清晰的多语言图像,并支持最多 14 张图像合成、保持最多 5 人一致性,提供 2K 和 4K 分辨率及局部编辑、光照调整等控制。

    推荐理由:Google DeepMind 发布基于 Gemini 3 Pro 的图像生成编辑模型,读者可了解其文本渲染、多图合成与产品接入范围。

  1. Hugging Face Blog62

    Hugging Face 发布 Flux LoRA 快速推理优化配方

    Hugging Face 发布针对 Flux.1-Dev 的 LoRA 推理优化配方,结合 Flash Attention 3、torch.compile 与 FP8 量化,在 H100 上相比基线实现 2.23 倍加速。

    推荐理由:原文给出可复用的 LoRA 推理优化配方与实测延迟数据,读者可据此判断热切换与量化在自有硬件上的取舍。

  1. OpenAI News65

    OpenAI 在 API 中上线最新图像生成模型 gpt-image-1

    OpenAI 宣布最新图像生成模型已通过 gpt-image-1 在 API 中开放,开发者和企业可将其直接集成到自有工具和平台中,构建专业级、可定制的视觉内容。

    推荐理由:OpenAI 将最新图像生成模型以 gpt-image-1 接入 API,开发者可据此评估自有产品集成图像生成的门槛变化。

  1. OpenAI News75

    OpenAI 在 GPT-4o 中推出原生图像生成

    OpenAI 在 GPT-4o 中推出原生图像生成能力,官方称其在文本渲染和指令遵循上更强。该功能于 2025 年发布,相关入口为 ChatGPT Images 2.5。

    推荐理由:GPT-4o 原生图像生成上线,文本渲染与指令遵循能力提升,可据此判断多模态生成的新基线。

  2. OpenAI News73

    OpenAI 发布 GPT-4o 系统卡补充说明:4o 图像生成

    OpenAI 发布 GPT-4o 系统卡补充说明,介绍 4o 图像生成。官方称这是比此前 DALL·E 3 系列能力显著更强的图像生成方案,可生成照片级真实感输出,并能接收图像作为输入并进行变换。

    推荐理由:OpenAI 官方补充说明 GPT-4o 图像生成能力,读者可据此了解它与 DALL·E 3 的定位差异。

  1. Mistral AI66

    Mistral 为 le Chat 加入联网搜索、Canvas 与图像生成

    Mistral AI 为免费生成式 AI 助手 le Chat 推出多项 beta 新功能,包括带引用的联网搜索、用于构思与就地编辑和导出的 Canvas、文档与图像理解、图像生成以及可共享的 Agent。

    推荐理由:官方列出 le Chat 新增的联网搜索、Canvas、文档图像理解与图像生成,并给出与主流助手的逐项对比。

  1. Hugging Face Blog62

    Diffusers 支持 Stable Diffusion 3.5 Large,含 8B 与 timestep-distilled 两个 checkpoint

    Stable Diffusion 3.5 已在 Hugging Face Hub 上线并可通过 Diffusers 使用,发布包含 8B 的 Large 模型和 8B 的 timestep-distilled 模型,后者支持 4-8 步少步推理。

    推荐理由:Stable Diffusion 3.5 Large 已在 Hub 上线并接入 Diffusers,文中给出量化推理与 LoRA 训练的完整代码路径。

  1. Hugging Face Blog71

    Diffusers 集成 Stable Diffusion 3 Medium,含显存与性能优化

    Stability AI 的 Stable Diffusion 3 Medium(2B 参数)上线 Hugging Face Hub 并接入 Diffusers,同时提供 DreamBooth 与 LoRA 训练脚本。

    推荐理由:原文给出 SD3 Medium 的架构变化与 Diffusers 集成细节,读者可据此判断显存占用与推理速度的取舍。

  1. Hugging Face Blog62

    SegMind 发布 SegMoE 扩散模型混合专家框架

    SegMind 发布 SegMoE 框架,可从零构建混合专家(MoE)扩散模型,并已集成 Hugging Face diffusers。同时发布 SegMoE-2x1、SegMoE-4x2 和 SegMoE-SD4x2 三个模型,采用 Apache 2.0 许可,并提供 GitHub 仓库和 segmoe 包用于自建 MoE 模型。

    推荐理由:原文给出了从零构建 MoE 扩散模型的完整流程与显存门槛,读者可据此判断自己能否复现。

  1. Hugging Face Blog62

    如何在 Hugging Face Spaces 上用 Gradio 免费运行 ComfyUI 工作流

    Hugging Face 发布教程,介绍如何用 ComfyUI-to-Python-Extension 把 ComfyUI 工作流导出为纯 Python 脚本,再用 Gradio 封装成应用并部署到 Hugging Face Spaces 的 ZeroGPU 上免费运行。

    推荐理由:教程给出把 ComfyUI 工作流导出为 Python、封装 Gradio 并部署到 ZeroGPU 的完整步骤,可迁移到自己的工作流。

  1. Hugging Face Blog62

    Hugging Face 发布 SDXL Dreambooth LoRA 高级训练脚本与调参指南

    Hugging Face 发布 SDXL Dreambooth LoRA 高级训练脚本,将 Pivotal Tuning 与 Prodigy 优化器结合,并给出配套参数配置。

    推荐理由:汇总 SDXL Dreambooth LoRA 微调的社区实践,含 Pivotal Tuning 与 Prodigy 优化器的参数配置和对比实验。