华为 Mate 90 系列发布:麒麟 9050 Pro 首发,5999 元起即日开售
华为发布 Mate 90、Mate 90 Pro、Mate 90 Pro Max、Mate 90 RS 非凡大师四款旗舰,5999 元起即日全系开售。Mate 90 Pro Max 首发麒麟 9050 Pro,多核性能提升 23%、GPU 渲染提升 40%、NPU 提升 140%,并支持 120 帧极致光追。
华为发布 Mate 90、Mate 90 Pro、Mate 90 Pro Max、Mate 90 RS 非凡大师四款旗舰,5999 元起即日全系开售。Mate 90 Pro Max 首发麒麟 9050 Pro,多核性能提升 23%、GPU 渲染提升 40%、NPU 提升 140%,并支持 120 帧极致光追。
Google Research 提出 Diffusion Controller 框架,将扩散模型的去噪过程重构为连续控制问题,通过轻量级"转向阻尼器"网络在不改动基座模型权重的前提下引导生成。
Simon Willison 用 GPT-6 Astra 构建了实验性工具 Photo Scrubber,可自动识别人脸并模糊处理。该工具基于 Google 的 MediaPipe C++ 库,通过 @mediapipe/tasks-vision 编译为 WebAssembly,并使用 BlazeFace 人脸检测模型,全程在本地运行。
OpenAI 发布 ChatGPT Images 2.5,可将想法、草图与参考照片转化为更个性化、更精致的图像,并更贴近用户原本的构想。
推荐理由:OpenAI 官方发布 ChatGPT Images 2.5,读者可了解其在个性化图像生成上的定位与输入方式。
Google Research 在 ICLR 2026 论文中揭示,扩散模型的创造力源于神经网络训练中的 score smoothing 效应:权重衰减等正则化使学到的 score function 变平滑,让去噪过程在训练数据点之间插值,从而生成新样本。研究用一维 +1/-1 示例和两层 ReLU 网络实验验证,即使没有显式正则化,梯度训练的隐式正则化也能产生该效应。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型。
推荐理由:两款新模型同时开放开发者入口,并给出延迟、单价与能力边界,便于判断多模态流水线的成本与可行性。
Google Photos 的 Auto frame 新增一项基于机器学习的重构图能力,把照片理解为 3D 场景并自动调整相机位置与焦距,生成原本未拍到的内容。该方法分两步:先用内部 3D 点图估计模型重建人体与面部并估算原焦距,再用生成式潜在扩散模型填补新视角下的空洞。该功能已上线,面向含人物的照片自动处理,重构图结果作为 Auto frame 候选中的第二个版本供用户选择。
推荐理由:Google Photos 把 3D 场景估计与生成式补全结合,读者可了解拍照后改变机位这一编辑思路的实现路径。
OpenAI 发布 ChatGPT Images 2.0,改进了文字渲染、多语言支持和视觉推理能力。原文同时提到可查看 Images 2.5 的新变化。
推荐理由:官方给出图像生成能力的三项具体改进方向,可据此判断多语言与文字渲染场景的可用性变化。
ChatGPT 支持通过清晰的提示词生成并迭代图像,用户可在几分钟内产出高质量视觉内容。教程涵盖提示词撰写、设计反复修改等环节。
阿布扎比 TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。
推荐理由:原文给出 0.6B 早期融合模型在 SA-Co 与 PBench 上的分项对比,可据此判断单骨干架构在开放词汇感知上的取舍。
Google 开源的 SpeciesNet 模型可识别相机陷阱图像中近 2,500 个动物类别,训练数据达 6,500 万张标注图像,在标准笔记本上每天可处理约 3 万张图像,低端游戏 GPU 上可处理 25 万张以上。该模型一年前作为开源工具发布,已被哥伦比亚、爱达荷、澳大利亚和坦桑尼亚塞伦盖蒂等地的研究团队用于识别美洲狮、麋鹿、鹤鸵和狮子等物种。
Photoroom 在 Hugging Face 博客发布 PRX 系列第三篇,用 32 张 H200、约 1500 美元算力预算在 24 小时内训练出一个文生图扩散模型。
Google DeepMind 发布图像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),把 Nano Banana Pro 的世界知识、推理与画质带到 Flash 速度。
推荐理由:官方给出 Nano Banana 2 的能力清单与上线渠道,读者可据此判断 Pro 级图像能力下放到 Flash 速度后的可用范围。
Hugging Face 公布 PRX 文本到图像模型训练消融实验,基于 1.2B 参数的 PRX-1.2B 在 Flux VAE 潜空间训练 100k 步,数据集为 MidJourneyV6 生成的 100 万张 256×256 合成图像。
伯克利 AI 研究团队提出一种基于互信息的成像系统评估与优化框架,可直接从带噪测量中估计信息量,无需重建算法或任务专用解码器。该方法在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证,信息估计能预测下游解码性能,优化后的设计达到 SOTA 端到端方法水平,且内存和算力需求更低。相关论文发表于 NeurIPS 2025。
OpenAI 发布 ChatGPT Images 体验和 GPT-Image-1.5,后者已在 API 中提供。官方称新版 ChatGPT Images 速度更快,并提示可查看最新的 ChatGPT Images 2.5。
推荐理由:OpenAI 在 API 中上线 GPT-Image-1.5,并同步更新 ChatGPT 图像生成体验,可据此了解图像模型迭代方向。
Hugging Face Diffusers 宣布支持 FLUX.2,提供 Flux2Pipeline 与 Flux2Transformer2DModel,文本编码器使用 Mistral3ForConditionalGeneration。
推荐理由:Diffusers 集成 FLUX.2 并给出 4bit 量化加载示例,读者可据此了解在消费级显存上跑该模型的路径与限制。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,主打高保真图像生成与编辑,已在 Google AI Studio 和 Vertex AI 以付费预览形式逐步开放。
推荐理由:官方给出新图像模型的分辨率、文本渲染与搜索接地能力,可据此判断多模态应用的选型与成本取舍。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),这是基于 Gemini 3 Pro 的新一代图像生成与编辑模型,可生成更准确、文本更清晰的多语言图像,并支持最多 14 张图像合成、保持最多 5 人一致性,提供 2K 和 4K 分辨率及局部编辑、光照调整等控制。
推荐理由:Google DeepMind 发布基于 Gemini 3 Pro 的图像生成编辑模型,读者可了解其文本渲染、多图合成与产品接入范围。
Hugging Face 为开源工具 AI Sheets 发布重大更新,新增视觉能力,可在表格中查看、分析、提取图像信息,并生成和编辑图片,全程无需写代码。图像列支持描述分类、抽取结构化数据(如收据商户名、日期、金额)和添加元数据,文本列与图像列可在同一工作流中生成与转换内容,结果可导出为 CSV、Parquet 或上传至 Hub。
SchoolAI 基于 GPT-4.1、图像生成和 TTS 构建安全、教师引导的 AI 教学工具,已服务超 100 万个课堂,提升参与度、监督与个性化学习。
通过 Hugging Face MCP Server 将 Claude 连接至 Hugging Face Spaces,即可调用 FLUX.1 Krea [dev] 和 Qwen-Image 等模型生成图像。
Arm 发布面向图形与游戏开发者的 AI 超分方案 Neural Super Sampling(NSS),可在移动 GPU 的 Neural Accelerators 上实时运行。
Hugging Face 发布针对 Flux.1-Dev 的 LoRA 推理优化配方,结合 Flash Attention 3、torch.compile 与 FP8 量化,在 H100 上相比基线实现 2.23 倍加速。
推荐理由:原文给出可复用的 LoRA 推理优化配方与实测延迟数据,读者可据此判断热切换与量化在自有硬件上的取舍。
ChatGPT for Business 迎来 4 月更新,新增 o3 模型、图像生成、增强记忆以及内部知识接入能力。官方同步放出了这些功能的上手演示。
OpenAI 宣布最新图像生成模型已通过 gpt-image-1 在 API 中开放,开发者和企业可将其直接集成到自有工具和平台中,构建专业级、可定制的视觉内容。
推荐理由:OpenAI 将最新图像生成模型以 gpt-image-1 接入 API,开发者可据此评估自有产品集成图像生成的门槛变化。
OpenAI 在 GPT-4o 中推出原生图像生成能力,官方称其在文本渲染和指令遵循上更强。该功能于 2025 年发布,相关入口为 ChatGPT Images 2.5。
推荐理由:GPT-4o 原生图像生成上线,文本渲染与指令遵循能力提升,可据此判断多模态生成的新基线。
OpenAI 发布 GPT-4o 系统卡补充说明,介绍 4o 图像生成。官方称这是比此前 DALL·E 3 系列能力显著更强的图像生成方案,可生成照片级真实感输出,并能接收图像作为输入并进行变换。
推荐理由:OpenAI 官方补充说明 GPT-4o 图像生成能力,读者可据此了解它与 DALL·E 3 的定位差异。
Hugging Face Diffusers 团队实验性推出 Remote VAE,将潜空间扩散模型的 VAE 解码过程委托给远程 Inference Endpoints,以降低高分辨率图像和视频生成对消费级 GPU 的显存压力。
OpenAI 展示了用 ChatGPT 为美甲设计寻找灵感。用户可通过 ChatGPT 获取美甲创意与款式参考。
Hugging Face 发布首期 AI 艺术工具通讯,回顾 2024 年创意 AI 工具的关键进展。
Hugging Face 发布 TimmWrapper,让任意 timm 视觉模型可直接接入 transformers 生态,支持 pipeline API、Auto 类和 Trainer 微调。该工具约 5 行代码即可用 bitsandbytes 完成量化,并支持 torch.compile 加速推理与 LoRA 适配器微调,微调后模型还能回到 timm 使用。
Hugging Face 的 Data is Better Together 社区发布 Apache 2.0 许可的文本到图像偏好数据集,覆盖多种图像生成类别与不同模型家族。
Mistral AI 为免费生成式 AI 助手 le Chat 推出多项 beta 新功能,包括带引用的联网搜索、用于构思与就地编辑和导出的 Canvas、文档与图像理解、图像生成以及可共享的 Agent。
推荐理由:官方列出 le Chat 新增的联网搜索、Canvas、文档图像理解与图像生成,并给出与主流助手的逐项对比。
OpenAI 简化、稳定并扩展了连续时间一致性模型,仅用两步采样即可达到与领先扩散模型相当的样本质量。
Stable Diffusion 3.5 已在 Hugging Face Hub 上线并可通过 Diffusers 使用,发布包含 8B 的 Large 模型和 8B 的 timestep-distilled 模型,后者支持 4-8 步少步推理。
推荐理由:Stable Diffusion 3.5 Large 已在 Hub 上线并接入 Diffusers,文中给出量化推理与 LoRA 训练的完整代码路径。
Hugging Face 发布教程,介绍如何将顶点着色网格转换为 UV 贴图纹理网格,并开源了实现该流程的 InstantTexture 库,可通过 pip 安装后一行代码完成 .obj 到 .glb 的转换。教程用 xatlas 生成 UV 贴图,再经重心坐标插值填充纹理,并用修复、中值滤波、高斯模糊和 LANCZOS 下采样消除纹理空洞。
OpenAI 发布训练一致性模型的改进技术。一致性模型是一类新兴生成模型,无需对抗训练即可一步采样出高质量数据。
OpenAI 提出 Consistency Models,可在不依赖迭代采样的情况下生成图像、音频和视频,从而解决扩散模型生成速度慢的问题。扩散模型虽推动了图像、音频和视频生成领域的发展,但其迭代采样过程导致生成缓慢。
Stability AI 的 Stable Diffusion 3 Medium(2B 参数)上线 Hugging Face Hub 并接入 Diffusers,同时提供 DreamBooth 与 LoRA 训练脚本。
推荐理由:原文给出 SD3 Medium 的架构变化与 Diffusers 集成细节,读者可据此判断显存占用与推理速度的取舍。