跳到正文
10月1日周四
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准表现和内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。

9月3日周四
  1. OpenAI News76

    OpenAI 发布 GPT-6 Astra

    OpenAI 发布新一代模型 GPT-6 Astra,官方称其为目前最智能且对齐程度最高的模型。该模型在计算机操作、编码、网络安全和科学等方向具备 SOTA 能力。

    推荐理由:OpenAI 官方发布新一代模型,读者可据此了解其在计算机操作、编码与安全等方向的能力定位。

  2. OpenAI News77

    OpenAI 发布 GPT-6 Astra 安全概览

    OpenAI 发布 GPT-6 Astra 安全概览,称其是已广泛部署的最强模型,也是首个在 Preparedness Framework 下达到网络安全能力 Critical 级别的模型。

    推荐理由:OpenAI 官方给出 GPT-6 Astra 的安全能力定级,读者可据此了解该模型在网络安全维度上的定位。

9月1日周二
  1. OpenAI News62

    OpenAI 称 Astra 成为首个触及关键网络安全能力阈值的模型

    OpenAI 表示 Astra 是其首个在 Preparedness Framework 下达到关键网络安全能力阈值的模型,发布时将配备更强的安全防护措施。该内容来自 OpenAI 官方博客 Path to Astra 一文,目前仅有摘要信息。

    推荐理由:OpenAI 首次披露 Astra 触及 Preparedness Framework 的关键网络安全能力阈值,读者可据此了解前沿模型发布前的安全门槛。

8月10日周一
8月4日周二
  1. Mistral AI65

    Mistral AI 发布 Shieldstral 3B 开源多模态安全分类器

    Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可发布,可在单张 16GB NVIDIA GPU 上运行。它把内容审核建模为策略自适应的问答任务,推理时用自然语言写入策略并输出校准后的安全分数,无需重新训练即可统一文本与图像安全评估。官方称其在文本安全上可匹配最多 7 倍参数量的模型,并在多模态审核上取得新的 SOTA。

    推荐理由:3B 开源安全分类器把审核策略放进推理时的自然语言问题里,可据此判断小模型在内容审核上的替代空间。

7月17日周五
6月26日周五
  1. OpenAI News62

    OpenAI 预告下一代模型 GPT-5.6 Sol

    OpenAI 预告下一代模型 GPT-5.6 Sol,称其在编码、科学和网络安全方面具备更强能力,并搭配其最先进的安全技术栈。

    推荐理由:OpenAI 官方预告下一代模型 GPT-5.6 Sol,读者可据此了解其在编码、科学与网络安全上的能力方向。

6月5日周五
5月7日周四
4月22日周三
  1. OpenAI News62

    OpenAI 发布 Privacy Filter 开放权重模型

    OpenAI 发布 Privacy Filter,一款用于检测和脱敏文本中个人身份信息(PII)的开放权重模型,官方称其准确率达到 SOTA。目前公开信息仅为摘要,未披露模型规模、许可协议与开放入口。

    推荐理由:OpenAI 开源一款用于检测和脱敏文本 PII 的开放权重模型,可了解其在隐私合规场景的定位。

3月3日周二
12月23日周二
  1. Hugging Face Blog42

    AprielGuard:面向现代 LLM 系统安全与对抗鲁棒性的 8B 防护模型

    Hugging Face 发布 8B 参数安全防护模型 AprielGuard,可检测 16 类安全风险及提示注入、越狱、思维链污染、记忆投毒、多智能体攻击等对抗攻击,并覆盖工具调用与推理轨迹等智能体工作流。模型提供推理与非推理两种模式,兼顾可解释分类与低延迟生产部署。

12月11日周四
  1. OpenAI News67

    OpenAI 更新 GPT-5 系统卡,发布 GPT-5.2 模型系列

    OpenAI 发布 GPT-5 系列的最新模型家族 GPT-5.2,并更新了 GPT-5 系统卡。该系列模型的安全缓解方案与 GPT-5 系统卡和 GPT-5.1 系统卡中描述的基本一致。GPT-5.2 模型同样在多样化数据集上训练,包括互联网公开信息、与第三方合作获取的信息,以及用户或人类训练师与研究人员提供或生成的信息。

    推荐理由:OpenAI 公布 GPT-5.2 系统卡更新,说明其安全缓解措施与 GPT-5、GPT-5.1 基本一致,可据此了解该系列的安全策略延续。

11月12日周三
10月29日周三
4月29日周二
  1. Hugging Face Blog62

    Meta 发布 Llama Guard 4 与 Llama Prompt Guard 2

    Meta 发布 Llama Guard 4,一个 12B dense 多模态安全模型,以及两个 Llama Prompt Guard 2 模型(86M 和 22M 参数),模型 checkpoint 已上线 Hugging Face Hub 的 Llama 4 Collection。

    推荐理由:Meta 发布 Llama Guard 4 多模态安全模型与 Prompt Guard 2,读者可了解其架构裁剪方式与相对前代的性能变化。

7月31日周三
  1. Hugging Face Blog62

    Google 发布 Gemma 2 2B、ShieldGemma 与 Gemma Scope

    Google 在 Gemma 2 发布一个月后扩充模型阵容,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版),适合端侧使用,并可与 Gemma 2 27B 搭配做辅助生成,官方称可获得最高 3 倍加速且不损失质量。

    推荐理由:Gemma 2 新增 2B 小模型与安全分类器、可解释性工具,读者可据此判断端侧部署与内容审核的可用选项。

6月27日周四
3月29日周五
1月27日周四
  1. OpenAI News80

    OpenAI 发布 InstructGPT,成为 API 默认语言模型

    OpenAI 训练出比 GPT-3 更能遵循用户意图的语言模型 InstructGPT,同时更真实、毒性更低,采用其对齐研究中的技术并引入人类参与训练。这些模型现已作为 OpenAI API 的默认语言模型部署。

    推荐理由:OpenAI 官方说明 InstructGPT 的指令跟随与对齐改进,并交代其已成为 API 默认模型。