跳到正文
11月21日周五
  1. Hugging Face Blog62

    Hugging Face TRL 集成 RapidFire AI,微调实验提速最高 20 倍

    Hugging Face TRL 正式集成 RapidFire AI,用户可用 RFSFTConfig、RFDPOConfig、RFGRPOConfig 近乎零代码替换原有 SFT/DPO/GRPO 配置,在单张 GPU 上并发运行多组微调配置。

    推荐理由:官方集成给出了并发调度与实时控制的具体机制和基准数字,可据此判断微调实验流程能压缩多少时间。

11月20日周四
  1. Google DeepMind62

    Google 在 Gemini 应用中上线 AI 图像验证功能

    Google 在 Gemini 应用中上线图像验证功能,用户上传图片并提问即可借助 SynthID 数字水印判断该图是否由 Google AI 生成或编辑。SynthID 自 2023 年推出以来已为超过 200 亿件 AI 生成内容添加水印。

    推荐理由:原文说明了 Gemini 应用内图像验证的入口与 SynthID 水印机制,读者可据此了解 AI 生成内容的溯源方式。

  2. Google DeepMind78

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像模型

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,主打高保真图像生成与编辑,已在 Google AI Studio 和 Vertex AI 以付费预览形式逐步开放。

    推荐理由:官方给出新图像模型的分辨率、文本渲染与搜索接地能力,可据此判断多模态应用的选型与成本取舍。

  3. Google DeepMind82

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像生成与编辑模型

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),这是基于 Gemini 3 Pro 的新一代图像生成与编辑模型,可生成更准确、文本更清晰的多语言图像,并支持最多 14 张图像合成、保持最多 5 人一致性,提供 2K 和 4K 分辨率及局部编辑、光照调整等控制。

    推荐理由:Google DeepMind 发布基于 Gemini 3 Pro 的图像生成编辑模型,读者可了解其文本渲染、多图合成与产品接入范围。

11月19日周三
  1. Mistral AI38

    Mistral AI 与 SAP、Helsing 达成合作,将在德国开设办公室

    Mistral AI 宣布与 SAP 建立多年合作伙伴关系,为其打造面向德国和欧洲的完全主权 AI 技术栈,并将模型集成进 SAP 的 AI Foundation,共同开发面向复杂行业与政府机构的定制方案。Mistral AI 同时与 Helsing 合作加速面向国防与安全应用的视觉-语言-动作模型研发。该公司还将在未来数月内于德国开设办公室,并大幅扩充本地团队。

  2. Google Research74

    Google 发布端到端实时语音翻译模型,延迟降至 2 秒

    Google Research 介绍了一种端到端语音到语音翻译(S2ST)模型,直接生成译文音频并保留原说话人音色,延迟仅 2 秒,而现有级联系统通常有 4-5 秒延迟且会累积误差。

    推荐理由:Google 端到端语音翻译把延迟从 4-5 秒压到 2 秒并保留原说话人音色,可对照级联方案理解取舍。

  3. OpenAI News62

    OpenAI 发布 GPT-5.1-Codex-Max 系统卡

    OpenAI 发布 GPT-5.1-Codex-Max 系统卡,说明为该模型部署的安全措施。系统卡涵盖模型层缓解手段,包括针对有害任务和提示注入的专门安全训练,以及产品层缓解手段,如智能体沙箱和可配置网络访问。

    推荐理由:系统卡披露了 GPT-5.1-Codex-Max 在模型层与产品层采取的安全措施,可了解其针对提示注入与智能体沙箱的防护思路。

  4. OpenAI News78

    OpenAI 发布 GPT-5.1-Codex-Max 智能体编码模型

    OpenAI 发布 GPT-5.1-Codex-Max,一款面向 Codex 的更快、更智能的智能体编码模型。该模型针对长时间运行的项目级任务设计,强化了推理能力与 token 效率。

    推荐理由:OpenAI 发布面向 Codex 的智能体编码模型,读者可据此了解其在长时项目任务上的定位与效率取向。

  5. Google DeepMind33

    Google DeepMind 在新加坡开设新研究实验室,推进亚太 AI 发展

    Google DeepMind 在新加坡开设新研究实验室,聚焦推进 Gemini 核心能力与亚太语言文化包容性研究,其亚太团队过去一年已扩大逾一倍。该实验室将与当地政府、企业和学术机构合作,并延续与 AI Singapore 共建 SEA-LION 等项目,其中 SEA-LION v4 基于 Gemma 3 多模态能力构建。

  6. Google DeepMind93

    Google DeepMind 发布 Gemini 3,Pro 版预览上线并推出 Deep Think 模式

    Google DeepMind 发布 Gemini 3,首发 Gemini 3 Pro 预览版,并同步接入 Gemini 应用、搜索 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新智能体开发平台 Google Antigravity。

    推荐理由:Gemini 3 Pro 在多项基准上刷新成绩并同步接入搜索、Gemini 应用与开发者平台,可据此判断多模态与智能体能力的当前水位。

  7. Google DeepMind82

    Google 发布智能体开发平台 Antigravity

    Google 发布智能体开发平台 Antigravity,即日起免费公开预览,提供 Gemini 3 Pro 的宽松速率限制。该平台在传统 AI IDE 之外新增以智能体为中心的 Manager 界面,可并行编排多个工作区中的智能体,并支持浏览器控制与异步交互。

    推荐理由:Google 把 IDE 改造成以智能体为中心的开发平台,读者可据此判断异步编排与 Artifacts 验证会怎样改变编码工作流。

  8. Google Research80

    Google 发布生成式 UI:Gemini 应用与搜索 AI Mode 上线动态界面实验

    Google 发布生成式 UI 实现,由模型直接生成网页、游戏、工具等完整交互界面,而非只生成内容。该能力以 dynamic view 和 visual layout 两个实验在 Gemini 应用中推出,并集成到 Google Search 的 AI Mode,基于 Gemini 3 Pro 配合工具调用、系统指令与后处理实现。

    推荐理由:Google 把生成式 UI 从论文推进到 Gemini 与搜索的实测入口,读者可据此判断界面生成这一方向的产品化程度。

11月18日周二
11月17日周一
  1. Google DeepMind62

    Google DeepMind 发布天气预报模型 WeatherNext 2

    Google DeepMind 与 Google Research 发布天气预报模型 WeatherNext 2,称其生成预报速度比前代快 8 倍,分辨率最高可达 1 小时,并能在单个 TPU 上不到一分钟生成数百种可能天气情景。

    推荐理由:官方给出 8 倍生成速度、1 小时分辨率与 99.9% 变量超越前代等指标,可据此判断 AI 天气预报的可用性边界。

11月14日周五
11月13日周四
  1. Google DeepMind71

    Google DeepMind 发布 SIMA 2:可推理、对话并在 3D 虚拟世界中自我改进的智能体

    Google DeepMind 发布 SIMA 2,将 Gemini 模型作为智能体核心,使 SIMA 从指令执行者升级为能思考目标、与用户对话并自我改进的交互式游戏伙伴。SIMA 2 在未训练过的新游戏(如 ASKA、MineDojo)中泛化能力显著提升,并能通过 Gemini 反馈和试错进行自我改进,无需额外人类演示数据。该研究以有限研究预览形式向少量学者和游戏开发者开放早期访问。

    推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,并展示了跨游戏泛化与自我改进的训练路径。

  2. Google Research62

    Google Quantum AI 提出量子优化工具包 DQI

    Google Quantum AI 与 Stanford、MIT、Caltech 合作在 Nature 发表论文,提出量子算法 Decoded Quantum Interferometry(DQI),利用量子干涉把优化问题转化为解码问题求解。

    推荐理由:Google Quantum AI 提出把优化问题转成解码问题的量子算法,并给出相对经典算法的运算量对比。

  3. OpenAI News78

    OpenAI 面向开发者发布 GPT-5.1

    GPT-5.1 已在 API 中开放,带来更快的自适应推理、扩展的提示词缓存和改进的编码表现。同时新增 apply_patch 和 shell 两个工具。

    推荐理由:GPT-5.1 进入 API,开发者可据此判断自适应推理、缓存与编码能力的升级幅度。

11月12日周三
  1. Google Research49

    Google 发布 JAX-Privacy 1.0:面向大规模机器学习的差分隐私工具库

    Google 发布 JAX-Privacy 1.0,这是构建在 JAX 之上、用于训练和审计差分隐私(DP)模型的工具库,重新设计以提升模块化。它提供逐样本梯度裁剪、噪声添加、数据批构建等核心组件,支持 DP-SGD、DP-FTRL 及 DP matrix factorization 等算法,并借助 JAX 的 vmap、shard_map 实现数据与模型并行的大规模训练。