跳到正文
12月24日周三
12月23日周二
  1. Hugging Face Blog42

    AprielGuard:面向现代 LLM 系统安全与对抗鲁棒性的 8B 防护模型

    Hugging Face 发布 8B 参数安全防护模型 AprielGuard,可检测 16 类安全风险及提示注入、越狱、思维链污染、记忆投毒、多智能体攻击等对抗攻击,并覆盖工具调用与推理轨迹等智能体工作流。模型提供推理与非推理两种模式,兼顾可解释分类与低延迟生产部署。

12月19日周五
12月18日周四
12月17日周三
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 3 Flash,主打速度与低成本

    Google DeepMind 发布 Gemini 3 Flash,定位为兼顾前沿智能与速度、成本更低的模型,已在 Gemini API、Google AI Studio、Gemini CLI、Google Antigravity、Vertex AI 和 Gemini Enterprise 上线,并开始向 Gemini 应用和搜索 AI Mode 全量推送。

    推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断速度与成本权衡是否适合自身工作流。

12月16日周二
12月11日周四
  1. OpenAI News82

    OpenAI 发布 GPT-5.2,面向科学与数学能力升级

    OpenAI 发布 GPT-5.2,称其为目前数学与科学能力最强的模型,在 GPQA Diamond 和 FrontierMath 等基准上刷新 SOTA。官方表示这些提升已转化为实际研究进展,包括解决一个开放理论问题并生成可靠的数学证明。

    推荐理由:OpenAI 官方给出 GPT-5.2 在数学与科学基准上的新结果,并说明这些提升如何落到实际研究进展中。

  2. OpenAI News82

    OpenAI 发布 GPT-5.2 前沿模型

    OpenAI 发布 GPT-5.2,称其为面向日常专业工作最先进的前沿模型,具备领先的推理、长上下文理解、编码和视觉能力。该模型已在 ChatGPT 和 OpenAI API 中提供,用于支撑更快、更可靠的智能体工作流。

    推荐理由:OpenAI 官方发布 GPT-5.2,读者可据此了解新模型在推理、长上下文、编码与视觉上的定位及可用入口。

12月5日周五
12月4日周四
12月3日周三
  1. Mistral AI80

    Mistral 发布 Mistral 3 系列,含 675B 参数 Mistral Large 3 与 3B/8B/14B Ministral 3

    Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个稠密小模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。

    推荐理由:Mistral 3 全系以 Apache 2.0 开源并给出 NVFP4 量化与多平台部署路径,可据此判断开源前沿模型的落地成本。

11月25日周二
  1. Hugging Face Blog22

    从第一性原理理解 continuous batching

    Hugging Face 发布博客,从 attention 机制与 KV caching 出发,通过优化吞吐量推导出 continuous batching。该方法通过并行处理多个对话、完成即换出,最大化高负载场景下的推理性能。文中指出 attention 是 token 间唯一交互之处,其计算量为 O(n²d),随序列长度呈平方增长。

11月24日周一
11月22日周六
  1. Google Research20

    Google Research 如何用简单线性回归模型预测 EV 充电桩可用性

    Google Research 提出一种轻量线性回归模型,预测未来若干分钟后 EV 充电端口可用的概率,以缓解续航焦虑。该模型以一天中各小时为特征、学习各时段占用变化权重,在 30 至 60 分钟预测区间上优于"保持当前状态"基线,主要靠识别高占用周转时刻取胜。评估覆盖 CA 和德国两地 100 个随机站点、每日采样 48 次、持续一周。

11月20日周四
11月19日周三
  1. Google DeepMind93

    Google DeepMind 发布 Gemini 3,Pro 版预览上线并推出 Deep Think 模式

    Google DeepMind 发布 Gemini 3,首发 Gemini 3 Pro 预览版,并同步接入 Gemini 应用、搜索 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新智能体开发平台 Google Antigravity。

    推荐理由:Gemini 3 Pro 在多项基准上刷新成绩并同步接入搜索、Gemini 应用与开发者平台,可据此判断多模态与智能体能力的当前水位。

11月13日周四
  1. Google DeepMind71

    Google DeepMind 发布 SIMA 2:可推理、对话并在 3D 虚拟世界中自我改进的智能体

    Google DeepMind 发布 SIMA 2,将 Gemini 模型作为智能体核心,使 SIMA 从指令执行者升级为能思考目标、与用户对话并自我改进的交互式游戏伙伴。SIMA 2 在未训练过的新游戏(如 ASKA、MineDojo)中泛化能力显著提升,并能通过 Gemini 反馈和试错进行自我改进,无需额外人类演示数据。该研究以有限研究预览形式向少量学者和游戏开发者开放早期访问。

    推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,并展示了跨游戏泛化与自我改进的训练路径。

  2. Google Research62

    Google Quantum AI 提出量子优化工具包 DQI

    Google Quantum AI 与 Stanford、MIT、Caltech 合作在 Nature 发表论文,提出量子算法 Decoded Quantum Interferometry(DQI),利用量子干涉把优化问题转化为解码问题求解。

    推荐理由:Google Quantum AI 提出把优化问题转成解码问题的量子算法,并给出相对经典算法的运算量对比。

  3. OpenAI News78

    OpenAI 面向开发者发布 GPT-5.1

    GPT-5.1 已在 API 中开放,带来更快的自适应推理、扩展的提示词缓存和改进的编码表现。同时新增 apply_patch 和 shell 两个工具。

    推荐理由:GPT-5.1 进入 API,开发者可据此判断自适应推理、缓存与编码能力的升级幅度。

11月1日周六
  1. Berkeley AI Research34

    无需 TD 学习的强化学习:分治法如何扩展到长时程任务

    一篇新文章提出用"分治"范式替代时序差分(TD)学习来做 off-policy 强化学习,通过将轨迹对半切分并组合子段价值来更新整体价值,理论上把 Bellman 递归次数从线性降到对数级。作者与 Aditya 合作的工作首次将分治价值学习扩展到目标条件强化学习这类复杂任务,且无需像 n-step TD 那样调节超参数 n。目前该方法仍面临如何选取最优子目标 w 的难题。

10月30日周四
  1. Hugging Face Blog42

    MiniMax M2 的智能体对齐:从基准测试到真实世界泛化

    MiniMax M2 的后训练团队分享了智能体对齐的核心经验:智能体需要交错思考(Interleaved Thinking),在任务全程而非仅在开头进行推理,以应对工具输出带来的持续扰动。团队发现,仅靠工具数量扩展无法实现泛化,真正的泛化要求模型对整个操作空间中的扰动保持稳定,包括系统提示词、用户提示词、环境和工具响应。M2 用户需保留包含思考步骤的完整会话历史,因为上下文就是它的记忆。

10月16日周四
9月29日周一
9月12日周五
9月11日周四
  1. Hugging Face Blog62

    Hugging Face 详解 transformers 为 OpenAI gpt-oss 引入的优化技巧

    Hugging Face 发布博客,介绍为支持 OpenAI gpt-oss 系列而在 transformers 中做的多项升级,包括可从 Hub 下载的零构建 Kernel、MXFP4 量化、张量并行、专家并行、动态滑动窗口层与缓存、连续批处理与 Paged Attention,以及更快的模型加载。

    推荐理由:Hugging Face 官方拆解了为 gpt-oss 引入 transformers 的七项工程改动,可据此了解量化、并行与缓存优化的落地方式。

8月14日周四
8月12日周二
8月7日周四
  1. OpenAI News82

    OpenAI 在 API 平台推出 GPT-5

    OpenAI 在 API 平台推出 GPT-5,主打高推理性能、面向开发者的新控制项,以及在真实编码任务上的领先结果。

    推荐理由:OpenAI 在 API 平台上线 GPT-5,开发者可据此了解新模型在推理与真实编码任务上的定位。

  2. OpenAI News86

    OpenAI 发布 GPT-5

    OpenAI 发布 GPT-5,称其为迄今最强的 AI 系统,在智能水平上较此前所有模型有显著跃升。官方称 GPT-5 在编码、数学、写作、健康、视觉感知等方面达到 SOTA 表现。

    推荐理由:OpenAI 官方发布 GPT-5,给出其在编码、数学、写作、健康与视觉感知上的能力定位。

8月5日周二
  1. OpenAI News82

    OpenAI 发布 gpt-oss-120b 与 gpt-oss-20b 两款开源权重模型

    OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开源权重语言模型,采用 Apache 2.0 许可。官方称这两款模型在推理任务上优于同规模开源模型,具备较强的工具调用能力,并针对消费级硬件的高效部署做了优化。

    推荐理由:OpenAI 开源两款权重模型并给出尺寸与许可,读者可据此判断消费级硬件上的部署与推理选择。

  2. Hugging Face Blog83

    OpenAI 发布开源模型家族 gpt-oss,含 117B 与 21B 两个版本

    OpenAI 发布开源权重模型家族 gpt-oss,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,两者均为 MoE 架构并采用 MXFP4 4-bit 量化,激活参数分别为 5.1B 和 3.6B,采用 Apache 2.0 许可。

    推荐理由:Hugging Face 汇总了 gpt-oss 两个开源模型的参数、量化方案与各推理框架的适配情况,可据此判断本地部署门槛。

7月17日周四
  1. Mistral AI72

    Mistral 为 Le Chat 推出 Deep Research、语音模式等多项新功能

    Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。

    推荐理由:Mistral 官方一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑能力,可据此判断其产品线的功能覆盖方向。

  2. Hugging Face Blog40

    Hugging Face 推出 FutureBench:评估 AI 智能体预测未来事件的能力

    Hugging Face 发布 FutureBench,用真实预测市场与新闻生成任务,评估 AI 智能体预测未来事件的能力。该基准通过 smolagents 智能体抓取新闻并用 DeepSeek-V3 生成预测问题,每周约产出 5 个新闻类问题,另从 Polymarket 每周引入约 8 个问题。其设计使数据污染不可能发生,结果可随时间客观验证。

7月10日周四
  1. Hugging Face Blog60

    Numina 与 Kimi 团队发布 Kimina-Prover-72B 定理证明模型

    Numina 与 Kimi 团队发布基于 Qwen2.5-72B、采用 Kimi k1.5 RL 流程训练的定理证明模型 Kimina-Prover-72B,同时开源基于 Qwen3-8B 和 Qwen3-1.7B 的两个蒸馏版本。

    推荐理由:原文给出 Kimina-Prover 系列在 miniF2F 上的成绩与 TTRL 搜索、错误修复两项方法细节,可据此了解形式化定理证明的当前进展。

7月8日周二
6月12日周四
6月10日周二