Google 2025 年度回顾:8 大研究突破领域
Google 发布 2025 年度研究回顾,梳理了 8 大突破领域。模型方面,Gemini 2.5 于 3 月发布,Gemini 3 于 11 月推出,Gemini 3 Flash 于 12 月上线,其中 Gemini 3 Pro 登顶 LMArena 排行榜,并在 MathArena Apex 上取得 23.4% 的 SOTA 成绩。
Google 发布 2025 年度研究回顾,梳理了 8 大突破领域。模型方面,Gemini 2.5 于 3 月发布,Gemini 3 于 11 月推出,Gemini 3 Flash 于 12 月上线,其中 Gemini 3 Pro 登顶 LMArena 排行榜,并在 MathArena Apex 上取得 23.4% 的 SOTA 成绩。
Hugging Face 发布 8B 参数安全防护模型 AprielGuard,可检测 16 类安全风险及提示注入、越狱、思维链污染、记忆投毒、多智能体攻击等对抗攻击,并覆盖工具调用与推理轨迹等智能体工作流。模型提供推理与非推理两种模式,兼顾可解释分类与低延迟生产部署。
Google Research 发布 2025 年度回顾,Gemini 3 成为其事实性最强的 LLM,在 SimpleQA Verified 和 FACTS 基准上达到 SOTA,并在 Gemini 3 中引入生成式 UI。Gemma 扩展至 140 多种语言,成为当前最佳多语言开源模型;量子方面,Willow 芯片上的 Quantum Echoes 算法比最强经典算法快 13000 倍。
OpenAI 推出针对思维链可监控性的新框架与评估套件,覆盖 24 种环境下的 13 项评估。结果显示,监控模型内部推理远比仅监控输出更有效,为 AI 系统能力提升后的可扩展控制提供了可行路径。
Google DeepMind 发布 Gemini 3 Flash,定位为兼顾前沿智能与速度、成本更低的模型,已在 Gemini API、Google AI Studio、Gemini CLI、Google Antigravity、Vertex AI 和 Gemini Enterprise 上线,并开始向 Gemini 应用和搜索 AI Mode 全量推送。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断速度与成本权衡是否适合自身工作流。
OpenAI 推出 FrontierScience 基准,用于测试 AI 在物理、化学和生物学领域的推理能力,衡量其向真实科学研究迈进的程度。
Google Research 为 STOC 2026 推出实验性 Paper Assistant Tool(PAT),基于 Gemini 2.5 Deep Think 的推理扩展方法,在投稿后 24 小时内为作者提供自动化预审反馈。
推荐理由:Google 官方披露 PAT 在 STOC 2026 的实测反馈数据,可了解 AI 辅助数学证明审阅的实际表现与局限。
OpenAI 发布 GPT-5.2,称其为目前数学与科学能力最强的模型,在 GPQA Diamond 和 FrontierMath 等基准上刷新 SOTA。官方表示这些提升已转化为实际研究进展,包括解决一个开放理论问题并生成可靠的数学证明。
推荐理由:OpenAI 官方给出 GPT-5.2 在数学与科学基准上的新结果,并说明这些提升如何落到实际研究进展中。
OpenAI 发布 GPT-5.2,称其为面向日常专业工作最先进的前沿模型,具备领先的推理、长上下文理解、编码和视觉能力。该模型已在 ChatGPT 和 OpenAI API 中提供,用于支撑更快、更可靠的智能体工作流。
推荐理由:OpenAI 官方发布 GPT-5.2,读者可据此了解新模型在推理、长上下文、编码与视觉上的定位及可用入口。
Google Research 发布 Titans 架构与 MIRAS 理论框架,将 RNN 的速度与 Transformer 的精度结合,通过深度神经网络作为长期记忆模块实现测试时记忆。
推荐理由:Google 提出 Titans 架构与 MIRAS 框架,用深度神经网络做长期记忆模块,为超长上下文建模提供新思路。
Intel AI Software Group 推出 DeepMath,一个基于 Qwen3-4B Thinking、用 GRPO 微调的数学推理 Agent,通过 smolagents 生成 Python 片段并在沙箱中执行,将结果折回推理过程。
Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个稠密小模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 全系以 Apache 2.0 开源并给出 NVFP4 量化与多平台部署路径,可据此判断开源前沿模型的落地成本。
Hugging Face 发布博客,从 attention 机制与 KV caching 出发,通过优化吞吐量推导出 continuous batching。该方法通过并行处理多个对话、完成即换出,最大化高负载场景下的推理性能。文中指出 attention 是 token 间唯一交互之处,其计算量为 O(n²d),随序列长度呈平方增长。
UCLA 教授 Ernest Ryu 与 GPT-5 解决了优化理论中的一个关键问题,展示了 AI 在加速数学发现中的作用。
Google Research 提出一种轻量线性回归模型,预测未来若干分钟后 EV 充电端口可用的概率,以缓解续航焦虑。该模型以一天中各小时为特征、学习各时段占用变化权重,在 30 至 60 分钟预测区间上优于"保持当前状态"基线,主要靠识别高占用周转时刻取胜。评估覆盖 CA 和德国两地 100 个随机站点、每日采样 48 次、持续一周。
OpenAI 公布首批研究案例,展示 GPT-5 在数学、物理、生物学和计算机科学领域加速科学进展。这些实验呈现 AI 与研究人员如何协作生成证明、发现新见解,并改变科学发现的速度。
ServiceNow 的 SLAM Lab 将 15B 推理模型改造成 Mamba 混合架构,旗舰 Apriel-H1-15b-Thinker-SFT 在吞吐提升 2.1 倍的同时推理质量基本持平,MATH500 从 0.90 升至 0.92、MTBench 从 8.30 升至 8.58,GSM8k、GPQA、AIME24 略有下降。
Google DeepMind 发布 Gemini 3,首发 Gemini 3 Pro 预览版,并同步接入 Gemini 应用、搜索 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新智能体开发平台 Google Antigravity。
推荐理由:Gemini 3 Pro 在多项基准上刷新成绩并同步接入搜索、Gemini 应用与开发者平台,可据此判断多模态与智能体能力的当前水位。
Google DeepMind 发布 SIMA 2,将 Gemini 模型作为智能体核心,使 SIMA 从指令执行者升级为能思考目标、与用户对话并自我改进的交互式游戏伙伴。SIMA 2 在未训练过的新游戏(如 ASKA、MineDojo)中泛化能力显著提升,并能通过 Gemini 反馈和试错进行自我改进,无需额外人类演示数据。该研究以有限研究预览形式向少量学者和游戏开发者开放早期访问。
推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,并展示了跨游戏泛化与自我改进的训练路径。
Google Quantum AI 与 Stanford、MIT、Caltech 合作在 Nature 发表论文,提出量子算法 Decoded Quantum Interferometry(DQI),利用量子干涉把优化问题转化为解码问题求解。
推荐理由:Google Quantum AI 提出把优化问题转成解码问题的量子算法,并给出相对经典算法的运算量对比。
GPT-5.1 已在 API 中开放,带来更快的自适应推理、扩展的提示词缓存和改进的编码表现。同时新增 apply_patch 和 shell 两个工具。
推荐理由:GPT-5.1 进入 API,开发者可据此判断自适应推理、缓存与编码能力的升级幅度。
一篇新文章提出用"分治"范式替代时序差分(TD)学习来做 off-policy 强化学习,通过将轨迹对半切分并组合子段价值来更新整体价值,理论上把 Bellman 递归次数从线性降到对数级。作者与 Aditya 合作的工作首次将分治价值学习扩展到目标条件强化学习这类复杂任务,且无需像 n-step TD 那样调节超参数 n。目前该方法仍面临如何选取最优子目标 w 的难题。
MiniMax M2 的后训练团队分享了智能体对齐的核心经验:智能体需要交错思考(Interleaved Thinking),在任务全程而非仅在开头进行推理,以应对工具输出带来的持续扰动。团队发现,仅靠工具数量扩展无法实现泛化,真正的泛化要求模型对整个操作空间中的扰动保持稳定,包括系统提示词、用户提示词、环境和工具响应。M2 用户需保留包含思考步骤的完整会话历史,因为上下文就是它的记忆。
Intel 与 Hugging Face 联合测试显示,在搭载 Intel Xeon 6 处理器(Granite Rapids)的 Google Cloud C4 虚拟机上运行 OpenAI GPT OSS 大模型,总拥有成本(TCO)较上一代 C3 实例提升 1.7 倍,即 70%。
Hugging Face 用 OpenVINO.GenAI 在 Intel Core Ultra 上加速 Qwen3-8B,以 Qwen3-0.6B 作草稿模型进行投机解码,生成速度提升约 1.3 倍。
WRITER 发布 Palmyra-mini 系列三款开源模型,参数规模 1.5B 至 1.7B,包括非思考基础版 palmyra-mini 及两款经 CoT 训练的推理变体 palmyra-mini-thinking-a 和 palmyra-mini-thinking-b。
Hugging Face 发布博客,介绍为支持 OpenAI gpt-oss 系列而在 transformers 中做的多项升级,包括可从 Hub 下载的零构建 Kernel、MXFP4 量化、张量并行、专家并行、动态滑动窗口层与缓存、连续批处理与 Paged Attention,以及更快的模型加载。
推荐理由:Hugging Face 官方拆解了为 gpt-oss 引入 transformers 的七项工程改动,可据此了解量化、并行与缓存优化的落地方式。
Hugging Face 发布开源训练管线 kimina-prover-rl,用于 Lean 4 形式化定理证明,基于 DeepSeek-R1 启发的"先推理后生成"范式,并完全兼容 verl 框架。
Hugging Face 发布 TextQuests 基准,基于 25 款经典 Infocom 互动小说游戏,测试 LLM 作为智能体的长上下文推理与探索学习能力。
OpenAI 在 API 平台推出 GPT-5,主打高推理性能、面向开发者的新控制项,以及在真实编码任务上的领先结果。
推荐理由:OpenAI 在 API 平台上线 GPT-5,开发者可据此了解新模型在推理与真实编码任务上的定位。
OpenAI 发布 GPT-5,称其为迄今最强的 AI 系统,在智能水平上较此前所有模型有显著跃升。官方称 GPT-5 在编码、数学、写作、健康、视觉感知等方面达到 SOTA 表现。
推荐理由:OpenAI 官方发布 GPT-5,给出其在编码、数学、写作、健康与视觉感知上的能力定位。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开源权重语言模型,采用 Apache 2.0 许可。官方称这两款模型在推理任务上优于同规模开源模型,具备较强的工具调用能力,并针对消费级硬件的高效部署做了优化。
推荐理由:OpenAI 开源两款权重模型并给出尺寸与许可,读者可据此判断消费级硬件上的部署与推理选择。
OpenAI 发布开源权重模型家族 gpt-oss,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,两者均为 MoE 架构并采用 MXFP4 4-bit 量化,激活参数分别为 5.1B 和 3.6B,采用 Apache 2.0 许可。
推荐理由:Hugging Face 汇总了 gpt-oss 两个开源模型的参数、量化方案与各推理框架的适配情况,可据此判断本地部署门槛。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重推理模型,采用 Apache 2.0 许可,并适用 gpt-oss 使用政策。
推荐理由:OpenAI 以 Apache 2.0 开源两款推理模型,读者可据此了解开放权重模型的新选项与许可条件。
Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:Mistral 官方一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑能力,可据此判断其产品线的功能覆盖方向。
Hugging Face 发布 FutureBench,用真实预测市场与新闻生成任务,评估 AI 智能体预测未来事件的能力。该基准通过 smolagents 智能体抓取新闻并用 DeepSeek-V3 生成预测问题,每周约产出 5 个新闻类问题,另从 Polymarket 每周引入约 8 个问题。其设计使数据污染不可能发生,结果可随时间客观验证。
Numina 与 Kimi 团队发布基于 Qwen2.5-72B、采用 Kimi k1.5 RL 流程训练的定理证明模型 Kimina-Prover-72B,同时开源基于 Qwen3-8B 和 Qwen3-1.7B 的两个蒸馏版本。
推荐理由:原文给出 Kimina-Prover 系列在 miniF2F 上的成绩与 TTRL 搜索、错误修复两项方法细节,可据此了解形式化定理证明的当前进展。
Hugging Face 发布 SmolLM3,一个完全开源的 3B 模型,在 11T token 上训练,支持 6 种语言和最长 128k 上下文,并提供 think / no_think 双模式推理。
推荐理由:Hugging Face 公开了 3B 模型的完整训练配方与数据配比,读者可据此复现或改进同规模模型。
TNG 在 24 张 H100 上自托管多个大语言模型,服务超 50 个应用,日均消耗超 1 亿 token、生成超 1000 万 token。其分析指出,vLLM 默认的 chunked-prefill 会顺序调度不同请求的 prefill,单个长提示词请求即可阻塞后续请求,显著拉高首 token 延迟。
Mistral AI 发布首款推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。
推荐理由:Mistral 首款推理模型同时给出开源小杯和企业版,并公开训练论文与评测数据,可对比其推理路线。