Hugging Face TRL 集成 RapidFire AI,微调实验提速最高 20 倍
Hugging Face TRL 正式集成 RapidFire AI,用户可用 RFSFTConfig、RFDPOConfig、RFGRPOConfig 近乎零代码替换原有 SFT/DPO/GRPO 配置,在单张 GPU 上并发运行多组微调配置。
推荐理由:官方集成给出了并发调度与实时控制的具体机制和基准数字,可据此判断微调实验流程能压缩多少时间。
Hugging Face TRL 正式集成 RapidFire AI,用户可用 RFSFTConfig、RFDPOConfig、RFGRPOConfig 近乎零代码替换原有 SFT/DPO/GRPO 配置,在单张 GPU 上并发运行多组微调配置。
推荐理由:官方集成给出了并发调度与实时控制的具体机制和基准数字,可据此判断微调实验流程能压缩多少时间。
Google 在 Gemini 应用中上线图像验证功能,用户上传图片并提问即可借助 SynthID 数字水印判断该图是否由 Google AI 生成或编辑。SynthID 自 2023 年推出以来已为超过 200 亿件 AI 生成内容添加水印。
推荐理由:原文说明了 Gemini 应用内图像验证的入口与 SynthID 水印机制,读者可据此了解 AI 生成内容的溯源方式。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,主打高保真图像生成与编辑,已在 Google AI Studio 和 Vertex AI 以付费预览形式逐步开放。
推荐理由:官方给出新图像模型的分辨率、文本渲染与搜索接地能力,可据此判断多模态应用的选型与成本取舍。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),这是基于 Gemini 3 Pro 的新一代图像生成与编辑模型,可生成更准确、文本更清晰的多语言图像,并支持最多 14 张图像合成、保持最多 5 人一致性,提供 2K 和 4K 分辨率及局部编辑、光照调整等控制。
推荐理由:Google DeepMind 发布基于 Gemini 3 Pro 的图像生成编辑模型,读者可了解其文本渲染、多图合成与产品接入范围。
OpenAI 与富士康达成合作,将在美国设计并制造下一代 AI 基础设施硬件。双方将共同开发多代数据中心系统,强化美国本土供应链,并在美国国内生产关键组件,以加速先进 AI 基础设施建设。
OpenAI 与 DoorDash、SCORE 及本地机构合作,帮助 1,000 家小企业用 AI 开展业务。这项名为 Small Business AI Jam 的计划为街边商户提供实操工具与培训,助其提升竞争力与增长。
OpenAI 公布首批研究案例,展示 GPT-5 在数学、物理、生物学和计算机科学领域加速科学进展。这些实验呈现 AI 与研究人员如何协作生成证明、发现新见解,并改变科学发现的速度。
Hugging Face 发布 Swift 包 AnyLanguageModel,作为 Apple Foundation Models 框架的替代方案,只需替换 import 语句即可保持同一套 API。
推荐理由:面向 Apple 平台的统一 LLM 调用接口,用同一套 API 在本地开源模型与云端模型间切换,可降低实验成本。
Mistral AI 宣布与 SAP 建立多年合作伙伴关系,为其打造面向德国和欧洲的完全主权 AI 技术栈,并将模型集成进 SAP 的 AI Foundation,共同开发面向复杂行业与政府机构的定制方案。Mistral AI 同时与 Helsing 合作加速面向国防与安全应用的视觉-语言-动作模型研发。该公司还将在未来数月内于德国开设办公室,并大幅扩充本地团队。
OpenAI 与独立专家合作评估前沿 AI 系统,通过第三方测试强化安全保障、验证防护措施,并提升模型能力与风险评估的透明度。
OpenAI 发文阐述 evals 如何帮助企业定义、衡量并改进 AI 表现,从而降低风险、提升生产力并形成战略优势。文章面向企业场景,说明 evals 在 AI 落地中的作用。
Google Research 介绍了一种端到端语音到语音翻译(S2ST)模型,直接生成译文音频并保留原说话人音色,延迟仅 2 秒,而现有级联系统通常有 4-5 秒延迟且会累积误差。
推荐理由:Google 端到端语音翻译把延迟从 4-5 秒压到 2 秒并保留原说话人音色,可对照级联方案理解取舍。
OpenAI 与 Target 达成合作,将在 ChatGPT 中推出全新 Target 应用,提供个性化购物和更快捷的结账体验。Target 还将扩大 ChatGPT Enterprise 的使用范围,以提升生产力和顾客体验。
ServiceNow 的 SLAM Lab 将 15B 推理模型改造成 Mamba 混合架构,旗舰 Apriel-H1-15b-Thinker-SFT 在吞吐提升 2.1 倍的同时推理质量基本持平,MATH500 从 0.90 升至 0.92、MTBench 从 8.30 升至 8.58,GSM8k、GPQA、AIME24 略有下降。
OpenAI 发布 GPT-5.1-Codex-Max 系统卡,说明为该模型部署的安全措施。系统卡涵盖模型层缓解手段,包括针对有害任务和提示注入的专门安全训练,以及产品层缓解手段,如智能体沙箱和可配置网络访问。
推荐理由:系统卡披露了 GPT-5.1-Codex-Max 在模型层与产品层采取的安全措施,可了解其针对提示注入与智能体沙箱的防护思路。
OpenAI 发布 ChatGPT for Teachers,一个具备教育级隐私和管理员控制的安全工作区。该版本面向通过验证的美国 K-12 教育工作者免费开放,有效期至 2027 年 6 月。
OpenAI 发布 GPT-5.1-Codex-Max,一款面向 Codex 的更快、更智能的智能体编码模型。该模型针对长时间运行的项目级任务设计,强化了推理能力与 token 效率。
推荐理由:OpenAI 发布面向 Codex 的智能体编码模型,读者可据此了解其在长时项目任务上的定位与效率取向。
全球制造商 Scania 正借助 ChatGPT Enterprise 在全员范围规模化部署 AI,通过按团队推进的上手方式和严格护栏机制提升生产力、质量与创新。
Google DeepMind 发布 Gemini 3,其中 Gemini 3 Pro 在各项主要 AI 基准上超过此前版本,编码能力也强于 2.5 Pro。
推荐理由:官方给出 Gemini 3 Pro 的基准成绩、API 定价与配套开发平台,便于开发者判断迁移成本。
Google DeepMind 在新加坡开设新研究实验室,聚焦推进 Gemini 核心能力与亚太语言文化包容性研究,其亚太团队过去一年已扩大逾一倍。该实验室将与当地政府、企业和学术机构合作,并延续与 AI Singapore 共建 SEA-LION 等项目,其中 SEA-LION v4 基于 Gemma 3 多模态能力构建。
Google DeepMind 发布 Gemini 3,首发 Gemini 3 Pro 预览版,并同步接入 Gemini 应用、搜索 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新智能体开发平台 Google Antigravity。
推荐理由:Gemini 3 Pro 在多项基准上刷新成绩并同步接入搜索、Gemini 应用与开发者平台,可据此判断多模态与智能体能力的当前水位。
Google 发布智能体开发平台 Antigravity,即日起免费公开预览,提供 Gemini 3 Pro 的宽松速率限制。该平台在传统 AI IDE 之外新增以智能体为中心的 Manager 界面,可并行编排多个工作区中的智能体,并支持浏览器控制与异步交互。
推荐理由:Google 把 IDE 改造成以智能体为中心的开发平台,读者可据此判断异步编排与 Artifacts 验证会怎样改变编码工作流。
Google 发布生成式 UI 实现,由模型直接生成网页、游戏、工具等完整交互界面,而非只生成内容。该能力以 dynamic view 和 visual layout 两个实验在 Gemini 应用中推出,并集成到 Google Search 的 AI Mode,基于 Gemini 3 Pro 配合工具调用、系统指令与后处理实现。
推荐理由:Google 把生成式 UI 从论文推进到 Gemini 与搜索的实测入口,读者可据此判断界面生成这一方向的产品化程度。
Intuit 与 OpenAI 达成超 1 亿美元多年期合作,将在 ChatGPT 中推出 Intuit 应用体验,并扩大使用 OpenAI 前沿模型打造个性化金融工具。
Google DeepMind 与 Google Research 发布天气预报模型 WeatherNext 2,称其生成预报速度比前代快 8 倍,分辨率最高可达 1 小时,并能在单个 TPU 上不到一分钟生成数百种可能天气情景。
推荐理由:官方给出 8 倍生成速度、1 小时分辨率与 99.9% 变量超越前代等指标,可据此判断 AI 天气预报的可用性边界。
OpenAI 被 Gartner 2025 生成式 AI 模型供应商创新指南评为"新兴领导者",该认可反映其企业端势头,目前已有超过 100 万家公司使用 ChatGPT 构建应用。
Hugging Face 的 kernels 库支持用 kernel-builder 构建并经由 kernels-community 分享自定义 GPU 内核,覆盖 CUDA、ROCm、Metal 和 XPU 后端。
OpenAI 推出 OpenAI for Ireland,与爱尔兰政府、Dogpatch Labs 和 Patch 合作,帮助中小企业、创业者和年轻开发者用 AI 创新、提升生产力并孵化下一代爱尔兰科技初创公司。
AMD 联合 Hugging Face 和 Data Monsters 举办 AMD Open Robotics Hackathon,首场线下赛事于 2025 年 12 月 5-7 日在东京举行,第二场于 12 月 12-14 日在巴黎举行。
Google DeepMind 联合 Google Research 发布 "Natural Forests of the World 2020" 地图与数据集,这是首个全球一致、10 米分辨率、能区分天然林与其他树木覆盖的地图,在独立全球数据集上验证准确率达 92.2%。
Google DeepMind 发布 SIMA 2,将 Gemini 模型作为智能体核心,使 SIMA 从指令执行者升级为能思考目标、与用户对话并自我改进的交互式游戏伙伴。SIMA 2 在未训练过的新游戏(如 ASKA、MineDojo)中泛化能力显著提升,并能通过 Gemini 反馈和试错进行自我改进,无需额外人类演示数据。该研究以有限研究预览形式向少量学者和游戏开发者开放早期访问。
推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,并展示了跨游戏泛化与自我改进的训练路径。
OpenAI 正在探索机制可解释性,以理解神经网络的推理过程。其提出的稀疏模型方法有望让 AI 系统更透明,并支持更安全、更可靠的行为。
Google Quantum AI 与 Stanford、MIT、Caltech 合作在 Nature 发表论文,提出量子算法 Decoded Quantum Interferometry(DQI),利用量子干涉把优化问题转化为解码问题求解。
推荐理由:Google Quantum AI 提出把优化问题转成解码问题的量子算法,并给出相对经典算法的运算量对比。
Hugging Face 宣布与 Google Cloud 建立更深层合作,让企业能在 Google Cloud 上用开放模型构建自己的 AI。
Philips 正借助 ChatGPT Enterprise 在 7 万名员工中规模化推进 AI 素养培训,目标是让员工负责任地使用 AI,并改善全球医疗健康成果。
GPT-5.1 已在 API 中开放,带来更快的自适应推理、扩展的提示词缓存和改进的编码表现。同时新增 apply_patch 和 shell 两个工具。
推荐理由:GPT-5.1 进入 API,开发者可据此判断自适应推理、缓存与编码能力的升级幅度。
OpenAI 在 ChatGPT 中推出群聊功能,支持多人以及 ChatGPT 在同一个对话中协作。官方说明该功能用于与他人和 ChatGPT 共同协作。
Google 发布 JAX-Privacy 1.0,这是构建在 JAX 之上、用于训练和审计差分隐私(DP)模型的工具库,重新设计以提升模块化。它提供逐样本梯度裁剪、噪声添加、数据批构建等核心组件,支持 DP-SGD、DP-FTRL 及 DP matrix factorization 等算法,并借助 JAX 的 vmap、shard_map 实现数据与模型并行的大规模训练。
Neuro 使用 ChatGPT Business 在全国范围扩张,团队规模不到 70 人。该方案帮助其节省时间、降低成本,并将销售与运营环节更快的执行转化为增长。
OpenAI 正在反击《纽约时报》要求其交出 2000 万条私密 ChatGPT 对话的诉求,并加速推出新的安全与隐私保护措施以保护用户数据。