OpenAI 持续加固 ChatGPT Atlas 抵御提示词注入
OpenAI 正在用强化学习训练的自动化红队加固 ChatGPT Atlas,抵御提示词注入攻击。这一发现与修补的循环有助于尽早识别新型攻击手法,并在 AI 智能体能力增强的同时强化浏览器智能体的防御。
OpenAI 正在用强化学习训练的自动化红队加固 ChatGPT Atlas,抵御提示词注入攻击。这一发现与修补的循环有助于尽早识别新型攻击手法,并在 AI 智能体能力增强的同时强化浏览器智能体的防御。
Google DeepMind 发布 Gemini 3 Flash,定位为兼顾前沿智能与速度、成本更低的模型,已在 Gemini API、Google AI Studio、Gemini CLI、Google Antigravity、Vertex AI 和 Gemini Enterprise 上线,并开始向 Gemini 应用和搜索 AI Mode 全量推送。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断速度与成本权衡是否适合自身工作流。
OpenAI 宣布开发者可以向 ChatGPT 提交应用,经审核通过后会在产品内新设的应用目录中展示,便于用户发现。官方同时更新了工具、指南和 Apps SDK,用于构建把真实操作带入 ChatGPT 的对话原生体验。
推荐理由:OpenAI 开放 ChatGPT 应用提交与审核入口,开发者可据此判断接入路径和分发方式的变化。
IBM 研究团队开源的可配置通用智能体 CUGA 上线 Hugging Face Spaces,演示环境内置一个小型 CRM 系统和 20 个预配置工具,用于销售数据查询与 API 交互。
推荐理由:CUGA 在 AppWorld 与 WebArena 上的成绩和 Hugging Face Space 入口,让读者能判断可配置智能体的落地方式。
BNY 正借助 OpenAI 在全企业范围扩大 AI 应用,其平台 Eliza 已支持 20000 多名员工构建 AI 智能体,以提升效率和客户成果。
Podium 基于 OpenAI 的 GPT-5 构建了 AI 智能体"Jerry",为 10,000 多家中小企业提供服务,并带来 300% 的业务增长。该智能体作为 AI 队友,正在改变实体商家服务客户的方式。
Hugging Face 发布教程,展示如何让 OpenAI Codex 通过 HF Skills 仓库完成端到端机器学习实验,包括数据校验、硬件选择、提交 Hugging Face Jobs 训练、监控进度、评测并生成训练报告。
推荐理由:原文给出 Codex 调用 HF Skills 完成端到端微调的完整流程与成本区间,可据此判断智能体托管训练实验的可行边界。
Scout24 基于 GPT-5 打造了一款对话式助手,通过追问澄清、生成摘要和个性化房源推荐,重新定义房产搜索体验。
Mistral 发布 Devstral 2 编码模型家族,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,均开源,前者采用修改版 MIT 许可,后者采用 Apache 2.0。
推荐理由:官方给出两款开源编码模型的参数、许可与 SWE-bench 成绩,并附独立人工评测对比,可据此判断开源编码模型与闭源模型的差距。
OpenAI 在 Linux 基金会下联合发起 Agentic AI Foundation,并将 AGENTS.md 捐赠给该组织。该基金会旨在支持开放、可互操作的标准,以推动安全的智能体 AI 发展。
推荐理由:OpenAI 把 AGENTS.md 交给 Linux 基金会下的新组织,读者可据此了解智能体标准与开源治理的走向。
Instacart 与 OpenAI 深化长期合作,将首个完整集成的杂货购物与 Instant Checkout 支付应用带入 ChatGPT。用户可在 ChatGPT 内完成购物与支付,这是双方既有合作关系的进一步扩展。
Hugging Face 推出 Hugging Face Skills,让 Claude Code 等编码智能体直接提交云端 GPU 微调任务、监控进度并把模型推送到 Hub。
推荐理由:原文给出了一套可复用的技能包与完整操作流程,读者可据此让编码智能体接管微调全流程。
Intel AI Software Group 推出 DeepMath,一个基于 Qwen3-4B Thinking、用 GRPO 微调的数学推理 Agent,通过 smolagents 生成 Python 片段并在沙箱中执行,将结果折回推理过程。
Mirakl 正借助 AI 智能体与 ChatGPT Enterprise 重塑电商,实现更快的文档撰写和更智能的客户支持,并推进 Mirakl Nexus 的智能体原生电商建设。
Accenture 与 OpenAI 正展开合作,帮助企业将智能体 AI 能力引入业务核心,以释放新的增长空间。
Tavily 分享其深度研究智能体的构建经验,通过上下文工程把工具输出蒸馏为反思而非在上下文中累积原始 token,相比 LangChain 的 Open Deep Research 减少 66% token 消耗,并在 DeepResearch Bench 上达到 SOTA。
推荐理由:Tavily 复盘自建深度研究智能体的架构取舍,给出上下文工程与 token 消耗对比的具体做法,可迁移到其他长任务智能体。
Google DeepMind 宣布支持美国白宫 Genesis 计划,与美国能源部合作,向全部 17 个国家实验室提供前沿 AI for Science 模型和智能体工具的加速访问,首批上线的是基于 Gemini 的 AI co-scientist。
推荐理由:Google DeepMind 与美国能源部 17 个国家实验室的合作细节,展示了前沿 AI 模型进入国家级科研体系的具体路径。
OpenAI 与 Target 达成合作,将在 ChatGPT 中推出全新 Target 应用,提供个性化购物和更快捷的结账体验。Target 还将扩大 ChatGPT Enterprise 的使用范围,以提升生产力和顾客体验。
OpenAI 发布 GPT-5.1-Codex-Max 系统卡,说明为该模型部署的安全措施。系统卡涵盖模型层缓解手段,包括针对有害任务和提示注入的专门安全训练,以及产品层缓解手段,如智能体沙箱和可配置网络访问。
推荐理由:系统卡披露了 GPT-5.1-Codex-Max 在模型层与产品层采取的安全措施,可了解其针对提示注入与智能体沙箱的防护思路。
OpenAI 发布 GPT-5.1-Codex-Max,一款面向 Codex 的更快、更智能的智能体编码模型。该模型针对长时间运行的项目级任务设计,强化了推理能力与 token 效率。
推荐理由:OpenAI 发布面向 Codex 的智能体编码模型,读者可据此了解其在长时项目任务上的定位与效率取向。
Google DeepMind 发布 Gemini 3,其中 Gemini 3 Pro 在各项主要 AI 基准上超过此前版本,编码能力也强于 2.5 Pro。
推荐理由:官方给出 Gemini 3 Pro 的基准成绩、API 定价与配套开发平台,便于开发者判断迁移成本。
Google DeepMind 发布 Gemini 3,首发 Gemini 3 Pro 预览版,并同步接入 Gemini 应用、搜索 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新智能体开发平台 Google Antigravity。
推荐理由:Gemini 3 Pro 在多项基准上刷新成绩并同步接入搜索、Gemini 应用与开发者平台,可据此判断多模态与智能体能力的当前水位。
Google 发布智能体开发平台 Antigravity,即日起免费公开预览,提供 Gemini 3 Pro 的宽松速率限制。该平台在传统 AI IDE 之外新增以智能体为中心的 Manager 界面,可并行编排多个工作区中的智能体,并支持浏览器控制与异步交互。
推荐理由:Google 把 IDE 改造成以智能体为中心的开发平台,读者可据此判断异步编排与 Artifacts 验证会怎样改变编码工作流。
Google 发布生成式 UI 实现,由模型直接生成网页、游戏、工具等完整交互界面,而非只生成内容。该能力以 dynamic view 和 visual layout 两个实验在 Gemini 应用中推出,并集成到 Google Search 的 AI Mode,基于 Gemini 3 Pro 配合工具调用、系统指令与后处理实现。
推荐理由:Google 把生成式 UI 从论文推进到 Gemini 与搜索的实测入口,读者可据此判断界面生成这一方向的产品化程度。
AMD 联合 Hugging Face 和 Data Monsters 举办 AMD Open Robotics Hackathon,首场线下赛事于 2025 年 12 月 5-7 日在东京举行,第二场于 12 月 12-14 日在巴黎举行。
Google DeepMind 发布 SIMA 2,将 Gemini 模型作为智能体核心,使 SIMA 从指令执行者升级为能思考目标、与用户对话并自我改进的交互式游戏伙伴。SIMA 2 在未训练过的新游戏(如 ASKA、MineDojo)中泛化能力显著提升,并能通过 Gemini 反馈和试错进行自我改进,无需额外人类演示数据。该研究以有限研究预览形式向少量学者和游戏开发者开放早期访问。
推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,并展示了跨游戏泛化与自我改进的训练路径。
Google 推出数据科学智能体 DS-STAR,通过数据文件分析、LLM 评判验证和顺序规划迭代三项创新,在 DABStep、KramaBench、DA-Code 三个基准上超越 AutoGen 和 DA-Agent,准确率分别从 41.0% 提升至 45.2%、39.8% 提升至 44.7%、37.0% 提升至 38.5%,并登顶 DABStep 公开排行榜。
OpenAI 推出 Aardvark,一款 AI 驱动的安全研究员,可自主发现、验证并协助修复软件漏洞,并支持规模化处理。该系统目前处于私有测试阶段,可通过报名参与早期测试。
推荐理由:OpenAI 官方披露智能体安全研究员 Aardvark 的定位与私有测试入口,可据此了解其自主发现并修复漏洞的能力方向。
MiniMax M2 的后训练团队分享了智能体对齐的核心经验:智能体需要交错思考(Interleaved Thinking),在任务全程而非仅在开头进行推理,以应对工具输出带来的持续扰动。团队发现,仅靠工具数量扩展无法实现泛化,真正的泛化要求模型对整个操作空间中的扰动保持稳定,包括系统提示词、用户提示词、环境和工具响应。M2 用户需保留包含思考步骤的完整会话历史,因为上下文就是它的记忆。
OpenAI 详解其 ChatGPT 浏览器 Atlas 背后的新架构 OWL,该架构将 Chromium 解耦,实现快速启动、丰富 UI 以及由 ChatGPT 驱动的智能体浏览。
Google Research 发布 StreetReaderAI,一个基于 Gemini 的街景无障碍原型,通过 AI Describer 和 AI Chat 为盲人及低视力用户实时生成道路、路口和地点的语音描述,并支持语音或键盘漫游全景图像。
Google 公布基于 Gemini 模型的个人健康教练构建方式,采用多智能体框架协调对话、数据科学与领域专家子智能体,对睡眠和活动等生理时间序列数据做数值推理。
推荐理由:Google 公开了健康教练的技术路径,包括多智能体分工与 SHARP 评估框架,可了解 Gemini 在健康场景的落地方式。
Mistral 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,围绕可观测性、Agent Runtime 和 AI Registry 三大支柱构建。
推荐理由:Mistral 把自家大规模系统的可观测、执行与治理能力产品化,读者可据此判断企业 AI 从原型走向生产的工程路径。
Consensus 借助 GPT-5 和 OpenAI 的 Responses API 打造多智能体研究助手,可在数分钟内读取、分析并综合证据,帮助超过 800 万名研究人员加速科学发现。
Meta 与 Hugging Face 合作推出 OpenEnv Hub,一个面向智能体环境的开放社区共享平台,开发者可构建、分享和探索兼容 OpenEnv 的环境,用于训练和部署。
推荐理由:Meta 与 Hugging Face 联合推出智能体环境共享 Hub,并同步开放 0.1 规范草案,读者可据此了解智能体训练与部署的开放协作方式。
OpenAI 发布 ChatGPT Atlas,一款内置 ChatGPT 的浏览器。该文章后续说明 Atlas 已被弃用。
HiBob 借助 ChatGPT Enterprise 和自定义 GPT 构建了 2,500 个 GPT,用于扩大 AI 采用、提升营收并简化 HR 工作流。这些 GPT 还支撑了 Bob 平台中 AI 功能的交付。
OpenAI 在 ChatGPT 内推出新一代可直接对话的应用,开发者即日起可用新的 Apps SDK 构建,该 SDK 目前处于预览阶段。
推荐理由:OpenAI 在 ChatGPT 内开放应用形态并同步放出 Apps SDK 预览,开发者可据此判断接入入口与构建时机。
OpenAI 发布 AgentKit、扩展后的 Evals 能力以及面向智能体的强化微调(RFT),用于帮助开发者更快从原型走向生产。官方称这批工具覆盖智能体开发、评估与微调环节。
推荐理由:OpenAI 官方发布面向智能体开发的工具组合,读者可据此了解其从原型到生产的工具链布局。
OpenAI 使用内部 AI 销售助手对入站线索进行资格筛选、个性化回复,并帮助销售团队转化客户兴趣。该助手用于将客户兴趣转化为实际客户。