跳到正文
12月8日周一
12月4日周四
12月2日周二
12月1日周一
11月25日周二
  1. Hugging Face Blog62

    Tavily 如何构建达到 SOTA 的深度研究智能体

    Tavily 分享其深度研究智能体的构建经验,通过上下文工程把工具输出蒸馏为反思而非在上下文中累积原始 token,相比 LangChain 的 Open Deep Research 减少 66% token 消耗,并在 DeepResearch Bench 上达到 SOTA。

    推荐理由:Tavily 复盘自建深度研究智能体的架构取舍,给出上下文工程与 token 消耗对比的具体做法,可迁移到其他长任务智能体。

11月24日周一
  1. Google DeepMind62

    Google DeepMind 支持美国能源部 Genesis 计划,向 17 个国家实验室开放 AI 科研工具

    Google DeepMind 宣布支持美国白宫 Genesis 计划,与美国能源部合作,向全部 17 个国家实验室提供前沿 AI for Science 模型和智能体工具的加速访问,首批上线的是基于 Gemini 的 AI co-scientist。

    推荐理由:Google DeepMind 与美国能源部 17 个国家实验室的合作细节,展示了前沿 AI 模型进入国家级科研体系的具体路径。

11月19日周三
  1. OpenAI News62

    OpenAI 发布 GPT-5.1-Codex-Max 系统卡

    OpenAI 发布 GPT-5.1-Codex-Max 系统卡,说明为该模型部署的安全措施。系统卡涵盖模型层缓解手段,包括针对有害任务和提示注入的专门安全训练,以及产品层缓解手段,如智能体沙箱和可配置网络访问。

    推荐理由:系统卡披露了 GPT-5.1-Codex-Max 在模型层与产品层采取的安全措施,可了解其针对提示注入与智能体沙箱的防护思路。

  2. OpenAI News78

    OpenAI 发布 GPT-5.1-Codex-Max 智能体编码模型

    OpenAI 发布 GPT-5.1-Codex-Max,一款面向 Codex 的更快、更智能的智能体编码模型。该模型针对长时间运行的项目级任务设计,强化了推理能力与 token 效率。

    推荐理由:OpenAI 发布面向 Codex 的智能体编码模型,读者可据此了解其在长时项目任务上的定位与效率取向。

  3. Google DeepMind93

    Google DeepMind 发布 Gemini 3,Pro 版预览上线并推出 Deep Think 模式

    Google DeepMind 发布 Gemini 3,首发 Gemini 3 Pro 预览版,并同步接入 Gemini 应用、搜索 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新智能体开发平台 Google Antigravity。

    推荐理由:Gemini 3 Pro 在多项基准上刷新成绩并同步接入搜索、Gemini 应用与开发者平台,可据此判断多模态与智能体能力的当前水位。

  4. Google DeepMind82

    Google 发布智能体开发平台 Antigravity

    Google 发布智能体开发平台 Antigravity,即日起免费公开预览,提供 Gemini 3 Pro 的宽松速率限制。该平台在传统 AI IDE 之外新增以智能体为中心的 Manager 界面,可并行编排多个工作区中的智能体,并支持浏览器控制与异步交互。

    推荐理由:Google 把 IDE 改造成以智能体为中心的开发平台,读者可据此判断异步编排与 Artifacts 验证会怎样改变编码工作流。

  5. Google Research80

    Google 发布生成式 UI:Gemini 应用与搜索 AI Mode 上线动态界面实验

    Google 发布生成式 UI 实现,由模型直接生成网页、游戏、工具等完整交互界面,而非只生成内容。该能力以 dynamic view 和 visual layout 两个实验在 Gemini 应用中推出,并集成到 Google Search 的 AI Mode,基于 Gemini 3 Pro 配合工具调用、系统指令与后处理实现。

    推荐理由:Google 把生成式 UI 从论文推进到 Gemini 与搜索的实测入口,读者可据此判断界面生成这一方向的产品化程度。

11月14日周五
11月13日周四
  1. Google DeepMind71

    Google DeepMind 发布 SIMA 2:可推理、对话并在 3D 虚拟世界中自我改进的智能体

    Google DeepMind 发布 SIMA 2,将 Gemini 模型作为智能体核心,使 SIMA 从指令执行者升级为能思考目标、与用户对话并自我改进的交互式游戏伙伴。SIMA 2 在未训练过的新游戏(如 ASKA、MineDojo)中泛化能力显著提升,并能通过 Gemini 反馈和试错进行自我改进,无需额外人类演示数据。该研究以有限研究预览形式向少量学者和游戏开发者开放早期访问。

    推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,并展示了跨游戏泛化与自我改进的训练路径。

11月7日周五
10月30日周四
  1. OpenAI News60

    OpenAI 推出智能体安全研究员 Aardvark

    OpenAI 推出 Aardvark,一款 AI 驱动的安全研究员,可自主发现、验证并协助修复软件漏洞,并支持规模化处理。该系统目前处于私有测试阶段,可通过报名参与早期测试。

    推荐理由:OpenAI 官方披露智能体安全研究员 Aardvark 的定位与私有测试入口,可据此了解其自主发现并修复漏洞的能力方向。

  2. Hugging Face Blog42

    MiniMax M2 的智能体对齐:从基准测试到真实世界泛化

    MiniMax M2 的后训练团队分享了智能体对齐的核心经验:智能体需要交错思考(Interleaved Thinking),在任务全程而非仅在开头进行推理,以应对工具输出带来的持续扰动。团队发现,仅靠工具数量扩展无法实现泛化,真正的泛化要求模型对整个操作空间中的扰动保持稳定,包括系统提示词、用户提示词、环境和工具响应。M2 用户需保留包含思考步骤的完整会话历史,因为上下文就是它的记忆。

10月28日周二
  1. Google Research62

    Google 如何用 Gemini 构建个人健康教练

    Google 公布基于 Gemini 模型的个人健康教练构建方式,采用多智能体框架协调对话、数据科学与领域专家子智能体,对睡眠和活动等生理时间序列数据做数值推理。

    推荐理由:Google 公开了健康教练的技术路径,包括多智能体分工与 SHARP 评估框架,可了解 Gemini 在健康场景的落地方式。

10月24日周五
  1. Mistral AI62

    Mistral 发布 AI Studio 生产级 AI 平台

    Mistral 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,围绕可观测性、Agent Runtime 和 AI Registry 三大支柱构建。

    推荐理由:Mistral 把自家大规模系统的可观测、执行与治理能力产品化,读者可据此判断企业 AI 从原型走向生产的工程路径。

10月23日周四
  1. Hugging Face Blog71

    Meta 与 Hugging Face 联合推出 OpenEnv Hub 智能体环境共享平台

    Meta 与 Hugging Face 合作推出 OpenEnv Hub,一个面向智能体环境的开放社区共享平台,开发者可构建、分享和探索兼容 OpenEnv 的环境,用于训练和部署。

    推荐理由:Meta 与 Hugging Face 联合推出智能体环境共享 Hub,并同步开放 0.1 规范草案,读者可据此了解智能体训练与部署的开放协作方式。

10月21日周二
10月8日周三
10月6日周一
  1. OpenAI News67

    OpenAI 发布 AgentKit、新版 Evals 与智能体 RFT

    OpenAI 发布 AgentKit、扩展后的 Evals 能力以及面向智能体的强化微调(RFT),用于帮助开发者更快从原型走向生产。官方称这批工具覆盖智能体开发、评估与微调环节。

    推荐理由:OpenAI 官方发布面向智能体开发的工具组合,读者可据此了解其从原型到生产的工具链布局。

9月29日周一
  1. OpenAI News62

    OpenAI 在 ChatGPT 中推出 Instant Checkout 与 Agentic Commerce Protocol

    OpenAI 宣布在 ChatGPT 中迈出智能体电商的第一步,推出 Instant Checkout 和 Agentic Commerce Protocol,让用户、AI 智能体与商家可以在 ChatGPT 内共同完成购物。官方称这是其智能体电商方向的初步尝试。

    推荐理由:OpenAI 官方给出 ChatGPT 内购物与 Agentic Commerce Protocol 的起步方向,可据此观察智能体电商的落地形态。

9月25日周四
  1. OpenAI News60

    OpenAI 面向 Pro 用户推出 ChatGPT Pulse 预览

    OpenAI 面向移动端 Pro 用户发布 ChatGPT Pulse 预览版。Pulse 是一种新体验,ChatGPT 会主动做研究,基于用户的聊天记录、反馈以及日历等已连接应用,推送个性化更新。

    推荐理由:OpenAI 官方给出 Pulse 的预览范围与主动研究机制,读者可据此判断 ChatGPT 从被动应答转向主动推送的形态变化。

9月23日周二
  1. Hugging Face Blog49

    Hugging Face 发布 Smol2Operator:用两阶段后训练让 SmolVLM2-2.2B 学会 GUI 操作

    Hugging Face 发布 Smol2Operator,基于 SmolVLM2-2.2B-Instruct 通过两阶段训练将其从零 GUI 定位能力打造成可执行点击、输入等操作的智能体式 GUI coder。第一阶段先建立界面元素定位能力,第二阶段用 SFT 增强智能体推理,在 ScreenSpot-v2 基准上评估,并开源全部训练配方、数据处理工具、模型、demo 与数据集。

9月22日周一
9月15日周一
  1. OpenAI News60

    OpenAI 升级 Codex,提升速度与实时协作能力

    OpenAI 宣布升级 Codex,使其更快、更可靠,并增强实时协作和独立处理任务的能力。升级后的 Codex 可在终端、IDE、网页乃至手机等多种开发环境中使用。

    推荐理由:Codex 在速度、可靠性和实时协作上的升级,覆盖终端、IDE、网页和手机多个开发入口。

  2. OpenAI News66

    OpenAI 发布 GPT-5-Codex,为 Codex 智能体编码优化

    OpenAI 在 GPT-5 系统卡增补中发布新模型 GPT-5-Codex,这是 GPT-5 针对 Codex 中智能体编码进一步优化的版本。该模型会根据任务复杂度更动态地调整思考投入,对简单对话查询或小任务快速响应,对更复杂任务则独立工作更长时间。

    推荐理由:GPT-5 系统卡增补披露了面向 Codex 智能体编码优化的新模型,读者可了解其动态调整思考投入的机制。