跳到正文
3月17日周二
  1. OpenAI News62

    OpenAI 发布 GPT-5.4 mini 和 nano

    OpenAI 发布 GPT-5.4 mini 和 nano,是 GPT-5.4 的更小、更快版本。两款模型针对编码、工具调用、多模态推理以及高并发 API 和子智能体负载做了优化。

    推荐理由:OpenAI 在 GPT-5.4 之下补出 mini 与 nano 两档小模型,读者可据此判断高并发与子智能体场景的选型空间。

3月11日周三
  1. OpenAI News60

    OpenAI 为 Responses API 配备计算机环境,从模型走向智能体

    OpenAI 介绍如何用 Responses API、shell 工具和托管容器构建智能体运行时,让智能体在安全、可扩展的环境中处理文件、工具和状态。原文仅提供摘要,未给出具体版本号、开放时间或性能数据。

    推荐理由:OpenAI 官方说明如何用 Responses API、shell 工具与托管容器搭建智能体运行时,可了解其安全与扩展思路。

3月6日周五
3月5日周四
  1. OpenAI News87

    OpenAI 发布 GPT-5.4 前沿模型

    OpenAI 发布 GPT-5.4,称其为面向专业工作能力最强且高效的前沿模型,具备 SOTA 编码、计算机使用、工具搜索能力和 1M token 上下文窗口。

    推荐理由:OpenAI 官方公布 GPT-5.4 的定位与能力方向,可据此了解其面向专业工作的能力边界。

2月27日周五
2月26日周四
2月23日周一
2月19日周四
  1. Hugging Face Blog60

    IBM 与 UC Berkeley 用 IT-Bench 和 MAST 诊断企业级智能体为何失败

    IBM Research 与 UC Berkeley 合作,用 MAST(多智能体系统失败分类法)分析 ITBench 中 310 条 SRE 执行轨迹,覆盖 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 三类模型。

    推荐理由:IBM 与 UC Berkeley 用 MAST 分类法拆解 310 条 ITBench 执行轨迹,给出不同模型失败模式的差异与对应工程干预方向。

2月18日周三
2月12日周四
  1. Hugging Face Blog62

    OpenEnv 实践:在真实环境中评测工具型智能体

    Meta 与 Hugging Face 联合推出开源框架 OpenEnv,用于让智能体连接真实工具与 API 而非模拟环境,采用 Gym 风格 API 和标准 MCP 工具调用接口。

    推荐理由:Meta 与 Hugging Face 的 OpenEnv 框架及 Turing 日历环境给出了工具型智能体在权限与多步流程下的实测数据,可据此判断真实环境评测的难点。

2月11日周三
2月10日周二
2月5日周四
  1. OpenAI News78

    OpenAI 发布 GPT-5.3-Codex

    OpenAI 发布 GPT-5.3-Codex,这是一个 Codex 原生智能体,将前沿编码能力与通用推理结合,面向长周期、真实世界的技术工作。

    推荐理由:OpenAI 发布 Codex 原生智能体模型,读者可据此了解其在编码与通用推理上的定位。

  2. OpenAI News73

    OpenAI 发布 GPT-5.3-Codex 系统卡

    OpenAI 发布 GPT-5.3-Codex 系统卡,称其为目前能力最强的智能体编码模型。该模型将 GPT-5.2-Codex 的前沿编码性能与 GPT-5.2 的推理及专业知识能力结合在一起。

    推荐理由:官方系统卡给出 GPT-5.3-Codex 的能力定位,读者可据此了解它在编码与推理上的组合方式。

2月4日周三
2月2日周一
  1. OpenAI News62

    OpenAI 发布 macOS 版 Codex 应用

    OpenAI 发布 macOS 版 Codex 应用,定位为 AI 编码与软件开发的指挥中心,支持多个智能体、并行工作流和长时间运行的任务。

    推荐理由:OpenAI 官方发布 Codex 桌面应用,读者可了解其多智能体并行与长任务编排的定位。

1月29日周四
1月28日周三
  1. Mistral AI62

    Mistral 发布终端编码智能体 Mistral Vibe 2.0

    Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式,CLI 修复持续自动更新。

    推荐理由:官方给出 Vibe 2.0 的自定义子智能体、斜杠命令技能与定价变化,可据此判断终端编码智能体的能力边界与成本。

1月27日周二
1月23日周五
1月22日周四
1月21日周三
1月15日周四
  1. Hugging Face Blog66

    OpenAI 发起 Open Responses 开放推理标准,Hugging Face 生态支持

    OpenAI 发起、开源社区构建、Hugging Face 生态支持的 Open Responses 开放推理标准发布,基于 Responses API 设计,面向智能体场景。该标准默认无状态,支持加密推理,将流式输出建模为语义事件序列,并原生支持内部与外部工具及子智能体循环。开发者可通过 Hugging Face Inference Providers 和 Spaces 上的早期访问版本试用。

    推荐理由:OpenAI 发起、Hugging Face 生态支持的开放推理标准,读者可了解它如何替代 Chat Completion 格式并支持智能体循环。

1月8日周四
1月5日周一
12月24日周三
12月23日周二
  1. Hugging Face Blog42

    AprielGuard:面向现代 LLM 系统安全与对抗鲁棒性的 8B 防护模型

    Hugging Face 发布 8B 参数安全防护模型 AprielGuard,可检测 16 类安全风险及提示注入、越狱、思维链污染、记忆投毒、多智能体攻击等对抗攻击,并覆盖工具调用与推理轨迹等智能体工作流。模型提供推理与非推理两种模式,兼顾可解释分类与低延迟生产部署。