Google DeepMind 发布 Nano Banana 2 Lite 与 Gemini Omni Flash
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型。
推荐理由:两款新模型同时开放开发者入口,并给出延迟、单价与能力边界,便于判断多模态流水线的成本与可行性。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型。
推荐理由:两款新模型同时开放开发者入口,并给出延迟、单价与能力边界,便于判断多模态流水线的成本与可行性。
Google DeepMind 发布图像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),把 Nano Banana Pro 的世界知识、推理与画质带到 Flash 速度。
推荐理由:官方给出 Nano Banana 2 的能力清单与上线渠道,读者可据此判断 Pro 级图像能力下放到 Flash 速度后的可用范围。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,主打高保真图像生成与编辑,已在 Google AI Studio 和 Vertex AI 以付费预览形式逐步开放。
推荐理由:官方给出新图像模型的分辨率、文本渲染与搜索接地能力,可据此判断多模态应用的选型与成本取舍。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),这是基于 Gemini 3 Pro 的新一代图像生成与编辑模型,可生成更准确、文本更清晰的多语言图像,并支持最多 14 张图像合成、保持最多 5 人一致性,提供 2K 和 4K 分辨率及局部编辑、光照调整等控制。
推荐理由:Google DeepMind 发布基于 Gemini 3 Pro 的图像生成编辑模型,读者可了解其文本渲染、多图合成与产品接入范围。
OpenAI 发布 GPT-4o 系统卡补充说明,介绍 4o 图像生成。官方称这是比此前 DALL·E 3 系列能力显著更强的图像生成方案,可生成照片级真实感输出,并能接收图像作为输入并进行变换。
推荐理由:OpenAI 官方补充说明 GPT-4o 图像生成能力,读者可据此了解它与 DALL·E 3 的定位差异。
Hugging Face 发布 aMUSEd,一个基于掩码图像建模(MIM)的非扩散文生图模型,是对 Google MUSE 的开源复现,采用宽松许可证并以研究预览形式发布。
Hugging Face 发布 Würstchen 文本条件扩散模型,通过 Stage A 的 VQGAN 与 Stage B 的 Diffusion Autoencoder 两级压缩实现 42x 空间压缩,Stage C 在压缩潜空间中训练。
推荐理由:原文给出 42x 空间压缩与训练成本对比,读者可据此判断高效扩散模型在显存与算力上的取舍。
Segmind 开源了压缩版 Stable Diffusion 模型 SD-Small 和 SD-Tiny 的权重与蒸馏训练代码,两者参数量分别比基础模型少 35% 和 55%,同时保持接近的图像保真度。
推荐理由:Segmind 开源了 SD-Small 与 SD-Tiny 的蒸馏代码和权重,并给出参数量、加速比与使用方式,便于复现和二次微调。
OpenAI 发布 Point-E,一个可根据复杂提示词生成 3D 点云的系统。
rinna 推出日语专用文生图模型 Japanese Stable Diffusion,通过在约 1 亿张日语标注图像上微调 Stable Diffusion 实现,可理解日语特有词汇、拟声词与专有名词。
OpenAI 训练了一个名为 DALL·E 的神经网络,可根据自然语言描述生成图像,覆盖自然语言可表达的多种概念。
推荐理由:OpenAI 官方公布 DALL·E 这一从文本生成图像的神经网络,可据此了解文生图方向的早期起点。