跳到正文
12月19日周五
12月18日周四
  1. OpenAI News75

    OpenAI 发布 GPT-5.2-Codex 编码模型

    OpenAI 发布 GPT-5.2-Codex,称其为自家最先进的编码模型。该模型主打长程推理、大规模代码转换以及增强的网络安全能力。

    推荐理由:OpenAI 官方发布新一代编码模型,读者可据此了解其在长程推理与大规模代码改写上的定位。

  2. Hugging Face Blog36

    Transformers v5 重构 Tokenization:更简单、更清晰、更模块化

    Hugging Face 发布 Transformers v5,将 tokenizer 架构与训练词表分离,类似 PyTorch 分离网络结构与权重,使 tokenizer 可检查、可定制、可从零训练。v5 提供清晰的类层级和单一快速后端,支持 BPE、Unigram、WordPiece 等算法,并可通过 AutoTokenizer 自动选择正确的 tokenizer 类。

12月17日周三
  1. Mistral AI62

    Mistral 发布 OCR 3,表单与手写识别胜率较上代提升 74%

    Mistral 发布文档解析模型 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,官方称其准确率超过企业级文档处理方案和 AI 原生 OCR 方案。

    推荐理由:官方给出 OCR 3 相对上一代在表单、手写和复杂表格上的胜率与定价,可据此判断文档解析成本与适用场景。

  2. Google DeepMind87

    Google DeepMind 发布 Gemini 3 Flash,主打速度与低成本

    Google DeepMind 发布 Gemini 3 Flash,定位为兼顾前沿智能与速度、成本更低的模型,已在 Gemini API、Google AI Studio、Gemini CLI、Google Antigravity、Vertex AI 和 Gemini Enterprise 上线,并开始向 Gemini 应用和搜索 AI Mode 全量推送。

    推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断速度与成本权衡是否适合自身工作流。

  3. OpenAI News62

    OpenAI 开放开发者向 ChatGPT 提交应用

    OpenAI 宣布开发者可以向 ChatGPT 提交应用,经审核通过后会在产品内新设的应用目录中展示,便于用户发现。官方同时更新了工具、指南和 Apps SDK,用于构建把真实操作带入 ChatGPT 的对话原生体验。

    推荐理由:OpenAI 开放 ChatGPT 应用提交与审核入口,开发者可据此判断接入路径和分发方式的变化。

12月16日周二
  1. Google DeepMind62

    Google DeepMind 发布 Gemma Scope 2 可解释性工具套件

    Google DeepMind 发布 Gemma Scope 2,一套面向 Gemma 3 全系列(270M 至 27B 参数)的开源可解释性工具。该套件结合稀疏自编码器(SAEs)与 transcoders,覆盖模型每一层,并新增 skip-transcoders、跨层 transcoders 及针对聊天版本的越狱、拒答和思维链忠实度分析工具。

    推荐理由:Gemma Scope 2 覆盖 Gemma 3 全系列并公开工具与演示,读者可了解可解释性工具在模型安全审计上的最新进展。

  2. OpenAI News72

    OpenAI 发布 ChatGPT Images 与 GPT-Image-1.5

    OpenAI 发布 ChatGPT Images 体验和 GPT-Image-1.5,后者已在 API 中提供。官方称新版 ChatGPT Images 速度更快,并提示可查看最新的 ChatGPT Images 2.5。

    推荐理由:OpenAI 在 API 中上线 GPT-Image-1.5,并同步更新 ChatGPT 图像生成体验,可据此了解图像模型迭代方向。

12月13日周六
12月12日周五
12月11日周四
  1. Hugging Face Blog60

    llama.cpp 新增模型管理功能:router 模式支持动态加载与切换模型

    llama.cpp server 新增 router 模式,可在不重启服务的情况下动态加载、卸载和切换多个模型。该模式采用多进程架构,每个模型独立运行,单个模型崩溃不影响其他模型;支持自动发现缓存或 --models-dir 目录中的 GGUF 文件、按需加载、LRU 淘汰(默认 --models-max 为 4)以及按请求中的 model 字段路由。

    推荐理由:llama.cpp 新增 router 模式,可在不重启服务的前提下动态加载、卸载和切换多个模型,适合本地多模型部署场景。

  2. OpenAI News82

    OpenAI 发布 GPT-5.2,面向科学与数学能力升级

    OpenAI 发布 GPT-5.2,称其为目前数学与科学能力最强的模型,在 GPQA Diamond 和 FrontierMath 等基准上刷新 SOTA。官方表示这些提升已转化为实际研究进展,包括解决一个开放理论问题并生成可靠的数学证明。

    推荐理由:OpenAI 官方给出 GPT-5.2 在数学与科学基准上的新结果,并说明这些提升如何落到实际研究进展中。

  3. Google DeepMind34

    Google DeepMind 扩大与英国 AI Security Institute 的合作

    Google DeepMind 宣布与英国 AI Security Institute(AISI)签署新谅解备忘录,将合作从模型测试扩展到基础安全研究。双方将共享专有模型、数据与思路,并围绕 AI 推理过程监控(CoT)、社会情感错位及 AI 对经济系统的影响展开联合研究。Google DeepMind 自 AISI 2023 年 11 月成立起便与其合作测试其最强模型。

  4. Hugging Face Blog66

    Hugging Face 教程:用 Codex 和 HF Skills 端到端微调模型

    Hugging Face 发布教程,展示如何让 OpenAI Codex 通过 HF Skills 仓库完成端到端机器学习实验,包括数据校验、硬件选择、提交 Hugging Face Jobs 训练、监控进度、评测并生成训练报告。

    推荐理由:原文给出 Codex 调用 HF Skills 完成端到端微调的完整流程与成本区间,可据此判断智能体托管训练实验的可行边界。

  5. OpenAI News67

    OpenAI 更新 GPT-5 系统卡,发布 GPT-5.2 模型系列

    OpenAI 发布 GPT-5 系列的最新模型家族 GPT-5.2,并更新了 GPT-5 系统卡。该系列模型的安全缓解方案与 GPT-5 系统卡和 GPT-5.1 系统卡中描述的基本一致。GPT-5.2 模型同样在多样化数据集上训练,包括互联网公开信息、与第三方合作获取的信息,以及用户或人类训练师与研究人员提供或生成的信息。

    推荐理由:OpenAI 公布 GPT-5.2 系统卡更新,说明其安全缓解措施与 GPT-5、GPT-5.1 基本一致,可据此了解该系列的安全策略延续。

  6. OpenAI News62

    迪士尼与 OpenAI 达成协议,200 多个角色将进入 Sora

    迪士尼与 OpenAI 达成协议,将把迪士尼、漫威、皮克斯和星球大战的 200 多个角色引入 Sora,用于粉丝创作的短视频。协议还包含迪士尼在全公司范围使用 ChatGPT Enterprise 和 OpenAI API。

    推荐理由:迪士尼与 OpenAI 达成角色授权协议,读者可了解生成式视频在版权合作上的落地方式。

  7. OpenAI News82

    OpenAI 发布 GPT-5.2 前沿模型

    OpenAI 发布 GPT-5.2,称其为面向日常专业工作最先进的前沿模型,具备领先的推理、长上下文理解、编码和视觉能力。该模型已在 ChatGPT 和 OpenAI API 中提供,用于支撑更快、更可靠的智能体工作流。

    推荐理由:OpenAI 官方发布 GPT-5.2,读者可据此了解新模型在推理、长上下文、编码与视觉上的定位及可用入口。

  8. Google Research32

    Google 提出 Urania:用差分隐私框架分析 AI 聊天机器人使用情况

    Google 在 COLM 2025 论文中提出 Urania 框架,通过差分隐私(DP)聚类与 DP 关键词提取,从 LLM 聊天机器人对话中生成使用洞察,且 LLM 只接触匿名关键词、不接触原始对话。与基于 CLIO 的非隐私基线 Simple-CLIO 相比,其隐私摘要在一项评测中最高有 70% 的概率被 LLM 评估器偏好。隐私预算越紧,主题覆盖度越低,但摘要更简洁聚焦。

12月10日周三
12月9日周二
  1. Mistral AI80

    Mistral 发布 Devstral 2 编码模型家族与 Vibe CLI

    Mistral 发布 Devstral 2 编码模型家族,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,均开源,前者采用修改版 MIT 许可,后者采用 Apache 2.0。

    推荐理由:官方给出两款开源编码模型的参数、许可与 SWE-bench 成绩,并附独立人工评测对比,可据此判断开源编码模型与闭源模型的差距。