跳到正文
10月1日周四
9月30日周三
9月8日周二
  1. OpenAI News62

    OpenAI 发布 ChatGPT Images 2.5

    OpenAI 发布 ChatGPT Images 2.5,可将想法、草图与参考照片转化为更个性化、更精致的图像,并更贴近用户原本的构想。

    推荐理由:OpenAI 官方发布 ChatGPT Images 2.5,读者可了解其在个性化图像生成上的定位与输入方式。

7月16日周四
  1. Google Research27

    Google Research 揭示扩散模型创造力来源:score smoothing 机制

    Google Research 在 ICLR 2026 论文中揭示,扩散模型的创造力源于神经网络训练中的 score smoothing 效应:权重衰减等正则化使学到的 score function 变平滑,让去噪过程在训练数据点之间插值,从而生成新样本。研究用一维 +1/-1 示例和两层 ReLU 网络实验验证,即使没有显式正则化,梯度训练的隐式正则化也能产生该效应。

7月1日周三
4月23日周四
  1. Google Research62

    Google Photos 上线 Auto frame 功能,可事后改变照片拍摄视角

    Google Photos 的 Auto frame 新增一项基于机器学习的重构图能力,把照片理解为 3D 场景并自动调整相机位置与焦距,生成原本未拍到的内容。该方法分两步:先用内部 3D 点图估计模型重建人体与面部并估算原焦距,再用生成式潜在扩散模型填补新视角下的空洞。该功能已上线,面向含人物的照片自动处理,重构图结果作为 Auto frame 候选中的第二个版本供用户选择。

    推荐理由:Google Photos 把 3D 场景估计与生成式补全结合,读者可了解拍照后改变机位这一编辑思路的实现路径。

4月21日周二
  1. OpenAI News67

    OpenAI 推出 ChatGPT Images 2.0

    OpenAI 发布 ChatGPT Images 2.0,改进了文字渲染、多语言支持和视觉推理能力。原文同时提到可查看 Images 2.5 的新变化。

    推荐理由:官方给出图像生成能力的三项具体改进方向,可据此判断多语言与文字渲染场景的可用性变化。

4月10日周五
4月1日周三
  1. Hugging Face Blog62

    TII 发布 Falcon Perception 与 Falcon OCR 模型

    阿布扎比 TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。

    推荐理由:原文给出 0.6B 早期融合模型在 SA-Co 与 PBench 上的分项对比,可据此判断单骨干架构在开放词汇感知上的取舍。

3月7日周六
  1. Google Research38

    Google SpeciesNet:用 AI 识别野生动物,一年间在全球保护项目落地

    Google 开源的 SpeciesNet 模型可识别相机陷阱图像中近 2,500 个动物类别,训练数据达 6,500 万张标注图像,在标准笔记本上每天可处理约 3 万张图像,低端游戏 GPU 上可处理 25 万张以上。该模型一年前作为开源工具发布,已被哥伦比亚、爱达荷、澳大利亚和坦桑尼亚塞伦盖蒂等地的研究团队用于识别美洲狮、麋鹿、鹤鸵和狮子等物种。

3月4日周三
2月27日周五
2月3日周二
1月10日周六
  1. Berkeley AI Research22

    伯克利提出信息驱动成像系统设计框架,登 NeurIPS 2025

    伯克利 AI 研究团队提出一种基于互信息的成像系统评估与优化框架,可直接从带噪测量中估计信息量,无需重建算法或任务专用解码器。该方法在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证,信息估计能预测下游解码性能,优化后的设计达到 SOTA 端到端方法水平,且内存和算力需求更低。相关论文发表于 NeurIPS 2025。

12月16日周二
  1. OpenAI News72

    OpenAI 发布 ChatGPT Images 与 GPT-Image-1.5

    OpenAI 发布 ChatGPT Images 体验和 GPT-Image-1.5,后者已在 API 中提供。官方称新版 ChatGPT Images 速度更快,并提示可查看最新的 ChatGPT Images 2.5。

    推荐理由:OpenAI 在 API 中上线 GPT-Image-1.5,并同步更新 ChatGPT 图像生成体验,可据此了解图像模型迭代方向。

11月25日周二
11月20日周四
  1. Google DeepMind78

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像模型

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,主打高保真图像生成与编辑,已在 Google AI Studio 和 Vertex AI 以付费预览形式逐步开放。

    推荐理由:官方给出新图像模型的分辨率、文本渲染与搜索接地能力,可据此判断多模态应用的选型与成本取舍。

  2. Google DeepMind82

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像生成与编辑模型

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),这是基于 Gemini 3 Pro 的新一代图像生成与编辑模型,可生成更准确、文本更清晰的多语言图像,并支持最多 14 张图像合成、保持最多 5 人一致性,提供 2K 和 4K 分辨率及局部编辑、光照调整等控制。

    推荐理由:Google DeepMind 发布基于 Gemini 3 Pro 的图像生成编辑模型,读者可了解其文本渲染、多图合成与产品接入范围。

10月21日周二
  1. Hugging Face Blog58

    Hugging Face AI Sheets 新增图像支持

    Hugging Face 为开源工具 AI Sheets 发布重大更新,新增视觉能力,可在表格中查看、分析、提取图像信息,并生成和编辑图片,全程无需写代码。图像列支持描述分类、抽取结构化数据(如收据商户名、日期、金额)和添加元数据,文本列与图像列可在同一工作流中生成与转换内容,结果可导出为 CSV、Parquet 或上传至 Hub。

9月22日周一
8月19日周二
8月12日周二
7月23日周三
4月24日周四
4月23日周三
3月25日周二
  1. OpenAI News75

    OpenAI 在 GPT-4o 中推出原生图像生成

    OpenAI 在 GPT-4o 中推出原生图像生成能力,官方称其在文本渲染和指令遵循上更强。该功能于 2025 年发布,相关入口为 ChatGPT Images 2.5。

    推荐理由:GPT-4o 原生图像生成上线,文本渲染与指令遵循能力提升,可据此判断多模态生成的新基线。

  2. OpenAI News73

    OpenAI 发布 GPT-4o 系统卡补充说明:4o 图像生成

    OpenAI 发布 GPT-4o 系统卡补充说明,介绍 4o 图像生成。官方称这是比此前 DALL·E 3 系列能力显著更强的图像生成方案,可生成照片级真实感输出,并能接收图像作为输入并进行变换。

    推荐理由:OpenAI 官方补充说明 GPT-4o 图像生成能力,读者可据此了解它与 DALL·E 3 的定位差异。

2月24日周一
2月4日周二
1月31日周五
1月16日周四
12月9日周一
11月18日周一
  1. Mistral AI66

    Mistral 为 le Chat 加入联网搜索、Canvas 与图像生成

    Mistral AI 为免费生成式 AI 助手 le Chat 推出多项 beta 新功能,包括带引用的联网搜索、用于构思与就地编辑和导出的 Canvas、文档与图像理解、图像生成以及可共享的 Agent。

    推荐理由:官方列出 le Chat 新增的联网搜索、Canvas、文档图像理解与图像生成,并给出与主流助手的逐项对比。

10月23日周三
10月22日周二
  1. Hugging Face Blog62

    Diffusers 支持 Stable Diffusion 3.5 Large,含 8B 与 timestep-distilled 两个 checkpoint

    Stable Diffusion 3.5 已在 Hugging Face Hub 上线并可通过 Diffusers 使用,发布包含 8B 的 Large 模型和 8B 的 timestep-distilled 模型,后者支持 4-8 步少步推理。

    推荐理由:Stable Diffusion 3.5 Large 已在 Hub 上线并接入 Diffusers,文中给出量化推理与 LoRA 训练的完整代码路径。

9月30日周一
  1. Hugging Face Blog34

    Hugging Face 教程:将顶点着色网格转换为 UV 贴图纹理网格

    Hugging Face 发布教程,介绍如何将顶点着色网格转换为 UV 贴图纹理网格,并开源了实现该流程的 InstantTexture 库,可通过 pip 安装后一行代码完成 .obj 到 .glb 的转换。教程用 xatlas 生成 UV 贴图,再经重心坐标插值填充纹理,并用修复、中值滤波、高斯模糊和 LANCZOS 下采样消除纹理空洞。

6月20日周四
6月12日周三