Google Research 2025 年度回顾:更激进的突破,更大的影响力
Google Research 发布 2025 年度回顾,Gemini 3 成为其事实性最强的 LLM,在 SimpleQA Verified 和 FACTS 基准上达到 SOTA,并在 Gemini 3 中引入生成式 UI。Gemma 扩展至 140 多种语言,成为当前最佳多语言开源模型;量子方面,Willow 芯片上的 Quantum Echoes 算法比最强经典算法快 13000 倍。
Google Research 发布 2025 年度回顾,Gemini 3 成为其事实性最强的 LLM,在 SimpleQA Verified 和 FACTS 基准上达到 SOTA,并在 Gemini 3 中引入生成式 UI。Gemma 扩展至 140 多种语言,成为当前最佳多语言开源模型;量子方面,Willow 芯片上的 Quantum Echoes 算法比最强经典算法快 13000 倍。
Mistral 发布文档解析模型 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,官方称其准确率超过企业级文档处理方案和 AI 原生 OCR 方案。
推荐理由:官方给出 OCR 3 相对上一代在表单、手写和复杂表格上的胜率与定价,可据此判断文档解析成本与适用场景。
Google DeepMind 发布 Gemini 3 Flash,定位为兼顾前沿智能与速度、成本更低的模型,已在 Gemini API、Google AI Studio、Gemini CLI、Google Antigravity、Vertex AI 和 Gemini Enterprise 上线,并开始向 Gemini 应用和搜索 AI Mode 全量推送。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断速度与成本权衡是否适合自身工作流。
Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,面向实时语音智能体,提升了复杂工作流处理、指令遵循和自然对话能力。
推荐理由:官方给出 Gemini 2.5 Flash Native Audio 在函数调用、指令遵循和多轮对话上的具体提升数据,可据此判断语音智能体的可用性变化。
OpenAI 发布 GPT-5.2,称其为面向日常专业工作最先进的前沿模型,具备领先的推理、长上下文理解、编码和视觉能力。该模型已在 ChatGPT 和 OpenAI API 中提供,用于支撑更快、更可靠的智能体工作流。
推荐理由:OpenAI 官方发布 GPT-5.2,读者可据此了解新模型在推理、长上下文、编码与视觉上的定位及可用入口。
Google Research 在 NeurIPS 2025 发布 Massive Sound Embedding Benchmark(MSEB),用于标准化评测声音嵌入模型的八项核心能力,涵盖检索、推理、分类、转录、分割、聚类、重排与重建。
Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个稠密小模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 全系以 Apache 2.0 开源并给出 NVFP4 量化与多平台部署路径,可据此判断开源前沿模型的落地成本。
Google 在 Gemini 应用中上线图像验证功能,用户上传图片并提问即可借助 SynthID 数字水印判断该图是否由 Google AI 生成或编辑。SynthID 自 2023 年推出以来已为超过 200 亿件 AI 生成内容添加水印。
推荐理由:原文说明了 Gemini 应用内图像验证的入口与 SynthID 水印机制,读者可据此了解 AI 生成内容的溯源方式。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,主打高保真图像生成与编辑,已在 Google AI Studio 和 Vertex AI 以付费预览形式逐步开放。
推荐理由:官方给出新图像模型的分辨率、文本渲染与搜索接地能力,可据此判断多模态应用的选型与成本取舍。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),这是基于 Gemini 3 Pro 的新一代图像生成与编辑模型,可生成更准确、文本更清晰的多语言图像,并支持最多 14 张图像合成、保持最多 5 人一致性,提供 2K 和 4K 分辨率及局部编辑、光照调整等控制。
推荐理由:Google DeepMind 发布基于 Gemini 3 Pro 的图像生成编辑模型,读者可了解其文本渲染、多图合成与产品接入范围。
Google DeepMind 发布 Gemini 3,其中 Gemini 3 Pro 在各项主要 AI 基准上超过此前版本,编码能力也强于 2.5 Pro。
推荐理由:官方给出 Gemini 3 Pro 的基准成绩、API 定价与配套开发平台,便于开发者判断迁移成本。
Google DeepMind 发布 Gemini 3,首发 Gemini 3 Pro 预览版,并同步接入 Gemini 应用、搜索 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新智能体开发平台 Google Antigravity。
推荐理由:Gemini 3 Pro 在多项基准上刷新成绩并同步接入搜索、Gemini 应用与开发者平台,可据此判断多模态与智能体能力的当前水位。
Google 发布生成式 UI 实现,由模型直接生成网页、游戏、工具等完整交互界面,而非只生成内容。该能力以 dynamic view 和 visual layout 两个实验在 Gemini 应用中推出,并集成到 Google Search 的 AI Mode,基于 Gemini 3 Pro 配合工具调用、系统指令与后处理实现。
推荐理由:Google 把生成式 UI 从论文推进到 Gemini 与搜索的实测入口,读者可据此判断界面生成这一方向的产品化程度。
Google DeepMind 发布 SIMA 2,将 Gemini 模型作为智能体核心,使 SIMA 从指令执行者升级为能思考目标、与用户对话并自我改进的交互式游戏伙伴。SIMA 2 在未训练过的新游戏(如 ASKA、MineDojo)中泛化能力显著提升,并能通过 Gemini 反馈和试错进行自我改进,无需额外人类演示数据。该研究以有限研究预览形式向少量学者和游戏开发者开放早期访问。
推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,并展示了跨游戏泛化与自我改进的训练路径。
Google DeepMind 在 Nature 发表新论文,分析 AI 视觉模型与人类在视觉表征组织上的差异,并提出一种三步对齐方法。该方法先用 THINGS 数据集训练一个冻结主模型的小适配器作为教师模型,再生成包含百万张图像、数百万条类人判断的 AligNet 数据集,最后微调其他学生模型。
OpenAI 发布 IndQA,一个用于评估 AI 系统印度语言能力的新基准,由领域专家共建,覆盖 12 种语言和 10 个知识领域,重点考察文化理解与推理能力。
Google Research 发布 StreetReaderAI,一个基于 Gemini 的街景无障碍原型,通过 AI Describer 和 AI Chat 为盲人及低视力用户实时生成道路、路口和地点的语音描述,并支持语音或键盘漫游全景图像。
Hugging Face 发布指南,介绍如何用开源模型构建 OCR 流水线,并新增 Chandra 与 OlmOCR-2 两个模型及 OlmOCR 评测分数。指南覆盖当前 OCR 模型能力、微调与开箱即用的取舍、模型选型要点,以及用多模态检索和文档问答超越传统 OCR。
Hugging Face 为开源工具 AI Sheets 发布重大更新,新增视觉能力,可在表格中查看、分析、提取图像信息,并生成和编辑图片,全程无需写代码。图像列支持描述分类、抽取结构化数据(如收据商户名、日期、金额)和添加元数据,文本列与图像列可在同一工作流中生成与转换内容,结果可导出为 CSV、Parquet 或上传至 Hub。
Hugging Face 博客给出在 Intel CPU 上本地运行视觉语言模型(VLM)的三步流程:用 Optimum Intel 与 OpenVINO 将 SmolVLM2-256M-Video-Instruct 转换为 OpenVINO IR,再通过仅权重量化或静态量化压缩至 INT8,最后执行推理。
Hugging Face 博客发布三部分系列的第一篇,记录如何将 RedNote 的 3B OCR 模型 dots.ocr 转换为可在 Apple 设备端运行的 Core ML 模型。
OpenAI 发布视频生成模型 Sora 2,可在生成视频中同步对话与音效。原文同时说明 Sora 产品已不再提供。
推荐理由:OpenAI 发布视频生成模型 Sora 2,首次在生成视频中同步对话与音效,可据此了解视频生成的能力边界变化。
OpenAI 发布新一代视频与音频生成模型 Sora 2,并同步公开系统卡。相比 Sora,新模型在物理准确性、画面真实感、音画同步、可控性和风格覆盖范围上有所提升。
推荐理由:官方系统卡披露 Sora 2 在物理准确性、同步音频与可控性上的能力变化,可据此了解视频生成模型的新边界。
Hugging Face 发布 Smol2Operator,基于 SmolVLM2-2.2B-Instruct 通过两阶段训练将其从零 GUI 定位能力打造成可执行点击、输入等操作的智能体式 GUI coder。第一阶段先建立界面元素定位能力,第二阶段用 SFT 增强智能体推理,在 ScreenSpot-v2 基准上评估,并开源全部训练配方、数据处理工具、模型、demo 与数据集。
SchoolAI 基于 GPT-4.1、图像生成和 TTS 构建安全、教师引导的 AI 教学工具,已服务超 100 万个课堂,提升参与度、监督与个性化学习。
Hugging Face 发布 mmBERT,一个基于 ModernBERT 架构的多语言编码器模型,在 3T+ tokens、1800 多种语言上训练,成为首个在性能上超越 XLM-R 的多语言模型。base 版含 110M 非嵌入参数(总计 307M),采用 Gemma 2 tokenizer,训练分三阶段将语言数从 60 逐步扩展至 1833,并引入逆掩码率调度与退火语言学习等新技术。
OpenAI 发布 GPT-5,称其为迄今最强的 AI 系统,在智能水平上较此前所有模型有显著跃升。官方称 GPT-5 在编码、数学、写作、健康、视觉感知等方面达到 SOTA 表现。
推荐理由:OpenAI 官方发布 GPT-5,给出其在编码、数学、写作、健康与视觉感知上的能力定位。
Hugging Face 的 TRL 新增面向视觉语言模型的对齐能力,包括混合偏好优化 MPO、多模态 GRPO 以及 Qwen 提出的 GSPO,并扩展 RLOO 与 Online DPO 支持 VLM。
推荐理由:TRL 把 MPO、GRPO、GSPO 等对齐方法扩展到视觉语言模型,并给出可直接运行的训练脚本与 notebook。
Mistral 用 LoRA 微调 Pixtral-12B,在 Aerial Image Dataset(AID)卫星图像分类任务上显著优于基座模型。基座模型在 Playground、Stadium 等易混类别上会误判并偶发幻觉出不存在的类别名,微调后分类更准确。整个流程可通过 Mistral 微调 API 或 LaPlateforme UI 完成,无需大量超参数调优。
Figma 正用 AI 变革数字设计,David Kossnick 分享了 Figma Make 等工具如何让团队借助 AI 进行原型设计、协作与构建。这些工具正在重塑设计师、开发者以及非技术创作者的工作流程。
Hugging Face 开源长视频理解基准 TimeScope,通过在 1 分钟至 8 小时的视频中插入 5-10 秒的"needle"片段,评测模型的局部检索、信息综合与细粒度时序感知三项能力。结果显示,包括 Gemini 2.5-Pro 在内的领先视觉语言模型在真正的长视频时序理解上仍表现吃力,性能随视频变长明显下滑。
Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:Mistral 官方一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑能力,可据此判断其产品线的功能覆盖方向。
Invideo AI 借助 OpenAI 的 GPT-4.1、gpt-image-1 和文本转语音模型,把创意想法在几分钟内转化为专业视频,创作速度提升 10 倍。
Mistral 发布 Voxtral 语音理解模型,提供 24B 生产版和 3B 本地与端侧版,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟转写或 40 分钟理解,具备音频问答、摘要、多语言自动检测和语音直接触发函数调用能力,并保留 Mistral Small 3.1 的文本能力。
推荐理由:Mistral 开源两款语音理解模型,给出 32k 上下文、多语言与函数调用能力及低于同类 API 一半的价格,可据此判断开源语音方案的可用边界。
Hugging Face 发布 SmolLM3,一个完全开源的 3B 模型,在 11T token 上训练,支持 6 种语言和最长 128k 上下文,并提供 think / no_think 双模式推理。
推荐理由:Hugging Face 公开了 3B 模型的完整训练配方与数据配比,读者可据此复现或改进同规模模型。
Hugging Face 以 nanoVLM 项目为例,展示如何用五阶段构建高效多模态数据管道,解决 GPU 空转与填充浪费问题。朴素填充阶段约 60% 的 batch 被无用 padding token 占据,团队随后引入全局最大长度约束,并借助背包问题(knapsack)实现贪心打包,将序列按 token 数尽量塞满每个 batch。
NVIDIA 在 Hugging Face 发布 Llama Nemotron Nano VL,一个基于 Llama-3.1-8B-Instruct 和 C-RADIOv2-VLM-H 的 8B 视觉语言模型,面向发票、合同等复杂文档的智能文档处理与 OCR。
Gemma 3n 从 Google I/O 的预览版转为正式发布,已在 transformers、timm、MLX、llama.cpp、transformers.js、ollama 等主流开源库上线。
推荐理由:Gemma 3n 正式开源并接入主流推理库,读者可据此了解端侧多模态模型的硬件门槛与部署路径。
Hugging Face 发布 ScreenSuite,一个面向 GUI Agent 的评测套件,整合 13 项基准,覆盖感知、定位、单步动作和多步智能体四类能力。
推荐理由:Hugging Face 开源 GUI Agent 评测套件,读者可了解其 13 项基准覆盖的能力维度与纯视觉评测设定。
H Company 发布 Holo1 系列 Action VLM,包含 Holo1-3B 和 Holo1-7B,基于 Qwen2.5-VL 架构并已在 Hugging Face 开源,同时发布含 1,639 个类人 UI 任务的 WebClick 多模态定位基准。
推荐理由:原文给出开源模型规格、基准成绩与单任务成本,读者可据此判断网页自动化方案的落地门槛。