OpenAI Codex 推出插件、站点与标注功能,覆盖多类岗位与工作流
OpenAI 为 Codex 推出新插件、站点(sites)和标注(annotations)功能,面向分析师、营销人员、设计师、投资者等团队,帮助其用 AI 完成更多工作。原文未披露具体版本号、参数规模或可用性细节。
OpenAI 为 Codex 推出新插件、站点(sites)和标注(annotations)功能,面向分析师、营销人员、设计师、投资者等团队,帮助其用 AI 完成更多工作。原文未披露具体版本号、参数规模或可用性细节。
OpenAI 发布《The Next Era of Knowledge Work》报告,探讨 Codex 如何通过 AI 驱动的研究、数据分析、工作流自动化和内容创作提升生产力。报告称 Codex 正从开发者工具扩展为面向所有人的生产力工具。
Hugging Face 博客指出,企业 AI 试点大规模失败,症结在于缺少"智能体逻辑"这一引导层。IBM 用知识图谱、程序分析库等软件原语约束 LLM,在 Cobol/PL-1 应用理解中实现约 30× token 消耗降低,Aster 测试生成在 75+ 个 Java 应用上覆盖率提升 20%-45%、token 消耗最多降低 15×。
Google Research 在 I/O 2026 上公布多项进展,包括面向科研的 Gemini for Science 工具套件、智能体开发平台 Google Antigravity 2.0,以及健康、天气预报、量子计算等方向的研究成果。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产,并强调对专有数据和 IP 的完全控制。
推荐理由:Mistral 一次性公布工业工程 AI 栈、Vibe 智能体升级与自建数据中心,可看到其企业级全栈布局。
Mistral 宣布将 Le Chat 升级为统一 AI 智能体 Vibe,同时覆盖工作与编码场景,原有对话、设置和订阅方案全部保留。
推荐理由:Mistral 把 Le Chat 升级为统一智能体 Vibe,读者可据此判断工作与编码两类长任务如何被同一入口承接。
Endava 借助 Codex 构建智能体组织,将需求分析周期从数周缩短至数小时,并加速软件交付。该案例展示了 Codex 在企业级软件工程流程中的落地方式。
OpenAI、Thrive 和 Crete 用 Codex 构建了一个可自我改进的税务智能体,用于自动完成报税、提升准确性并加速工作流。该方案展示了 Codex 在税务申报自动化场景中的落地方式。
Warp 正基于 GPT-5.5 及 OpenAI 模型,在本地、云端和开源开发流程中协调多个编码智能体。该工具将 GPT-5.5 用于跨环境的编码智能体调度,以支持开源协作开发。
Hugging Face 发布 AI 智能体术语表,重点厘清常被混用的 harness 与 scaffold:scaffold 是定义模型行为的系统提示词、工具描述与上下文管理层,harness 则是调用模型、处理工具调用并决定何时停止的执行层,社区常用 Agent = Model + Harness 概括。
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密模型,以修改版 MIT 许可开放权重,成为 Mistral Vibe 和 Le Chat 的默认模型,并支撑 Vibe 的云端远程编码智能体与 Le Chat 的 Work 模式预览。
推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 权重,读者可据此判断自托管编码智能体的可行边界。
Mistral 在 Studio 发布 Connectors(公开预览),内置连接器和自定义 MCP 均可通过 API/SDK 用于所有模型与智能体调用。连接器以 MCP 协议打包为可复用实体,集中注册后可在 LeChat 和 AI Studio 中使用,并支持程序化创建、修改、列出和删除。
推荐理由:原文给出连接器注册、直接工具调用与人工审批三段能力,读者可据此判断企业级 Agent 集成层的落地方式。
Google 宣布把基于 Gemini 的科研工具 Empirical Research Assistance(ERA)开放给科学家使用,相关论文同日发表于 Nature。
推荐理由:Google 把 ERA 从 Nature 论文推进到可申请使用的工具,并给出八个跨学科应用案例,可据此判断科研编码自动化的落地边界。
Google DeepMind 在 Project Genie 中上线 Street View 真实影像锚定能力,用户可选取美国境内地点并叠加风格,生成以真实地点为起点的可交互世界。
推荐理由:Google DeepMind 把 Genie 的世界模型与 Street View 真实影像打通,读者可据此判断世界模型从纯生成走向现实锚定的路径。
Google DeepMind 推出 Gemini for Science,包含 Google Labs 上三个实验性工具:基于 Co-Scientist 的 Hypothesis Generation。
推荐理由:原文给出三类科学智能体实验工具与 Science Skills 的开放入口,可据此判断科研工作流的可迁移用法。
Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 正使用 Google DeepMind 的 Co-Scientist 整合分散的衰老生物学发现并生成可验证假设。
Google DeepMind 的 Co-Scientist 帮助 MIT 机械工程师 Ritu Raman 快速梳理 ALS 相关文献,将想法转化为可检验假设并按可行性与风险收益排序。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起在 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise 上线。
推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和 4 倍输出速度,可据此判断速度与质量的取舍是否成立。
OpenAI 在 ChatGPT 中推出个人理财功能,可连接账户、追踪支出与投资、管理订阅、制定预算并规划财务目标。该功能由 OpenAI 官方发布,具体开放范围与时间尚未在材料中说明。
推荐理由:OpenAI 官方披露 ChatGPT 个人理财功能的主要能力,读者可据此了解其覆盖的账户与预算场景。
Databricks 将 GPT-5.5 用于企业智能体工作流,此前该模型在 OfficeQA Pro 基准上刷新了 SOTA。
Sea Limited 首席产品官解释了公司为何在工程团队中全面部署 Codex,以加速亚洲地区的 AI 原生软件开发。
OpenAI 宣布 Codex 可在 ChatGPT 移动端使用,用户能跨设备和远程环境实时监控、引导并批准编码任务。该功能把 Codex 的编码任务管理从桌面扩展到移动端。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论并演化科学假设。
推荐理由:原文给出多智能体系统的三阶段架构与多个实验室应用案例,可了解 AI 参与科学假设生成的具体方式。
OpenAI 的 Parameter Golf 活动吸引 1000+ 名参与者、收到 2000+ 份提交,围绕 AI 辅助机器学习研究、编码智能体、量化和新型模型设计展开,且全程受严格约束。
OpenAI 通过沙箱、审批机制、网络策略和智能体原生遥测来安全运行 Codex,以支持编程智能体的安全合规采用。
Parloa 利用 OpenAI 模型驱动可扩展的语音 AI 客服智能体,让企业能够设计、模拟并部署可靠的实时交互。该方案面向语音驱动的客户服务场景,强调规模化与实时性。
Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的落地成果,覆盖数学、量子物理、基因组、电网与 AI 基础设施等领域。
推荐理由:官方汇总 AlphaEvolve 一年落地案例,涵盖基因组、电网、TPU 与量子模拟,可据此判断编码智能体的跨领域迁移边界。
Uber 正用 OpenAI 驱动其 AI 助手与语音功能,帮助司机更聪明地赚钱、乘客更快叫车,服务覆盖全球实时交易市场。
OpenAI 的 B2B Signals 研究显示,前沿企业正通过深化 AI 采用、规模化 Codex 驱动的智能体工作流来构建持久的竞争优势。
Singular Bank 基于 ChatGPT 和 Codex 构建了内部助手 Singularity,帮助银行家在会议准备、投资组合分析和后续跟进上每天节省 60–90 分钟。
OpenAI 与 PwC 达成合作,帮助企业用 AI 智能体自动化财务工作流、改进预测、强化管控并推动 CFO 职能现代化。
Import AI 作者 Jack Clark 认为,到 2028 年底有 60% 以上概率出现无需人类参与的 AI 研发,即前沿模型能自主训练出自己的后继版本。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗的“三方照护”模式。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,优于医生常用的两款 AI 系统;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体仍更强。
推荐理由:DeepMind 公开医疗 AI 智能体的多模态评测细节,读者可据此了解 AI 在临床问诊中已达标与仍欠缺的具体环节。
Google Research 汇总了科学家使用 Empirical Research Assistance(ERA)的四类实践:公共卫生领域,团队每周向 CDC 的流感。
推荐理由:Google 官方汇总 ERA 在流行病预测、宇宙学、碳监测与神经科学四类真实科研任务中的使用结果,可了解 AI 辅助科研的落地边界。
OpenAI 的 GPT 模型、Codex 和 Managed Agents 现已在 AWS 上可用,企业可在自己的 AWS 环境中构建安全的 AI 应用。
推荐理由:OpenAI 把 GPT 模型、Codex 与 Managed Agents 接入 AWS,读者可据此判断企业现有云环境能否直接落地。
Mistral AI 发布 Workflows 公开预览,定位为企业 AI 的编排层,提供持久化执行、可观测性和容错能力,用于把 AI 流程从概念验证推进到生产。
推荐理由:原文给出企业级 AI 编排层的持久化执行、可观测与人工审批能力,以及控制面与数据面分离的部署方式,可供评估生产落地路径。
Choco 利用 OpenAI API 构建 AI 智能体,实现食品分销流程自动化,以提升生产力并推动业务增长。这是 OpenAI 发布的一则客户案例,聚焦 AI 在真实场景中的落地成效。
OpenAI 发布开源规范 Symphony,用于 Codex 编排,可把 issue tracker 变成常驻的智能体系统。该规范旨在提升工程产出并减少上下文切换。
DeepSeek 发布 V4,两个 MoE 检查点上线 Hub:DeepSeek-V4-Pro 总参数 1.6T、激活 49B,DeepSeek-V4-Flash 总参数 284B、激活 13B,均支持 1M token 上下文窗口。
推荐理由:原文给出 V4 在长上下文推理成本与智能体后训练上的具体设计,可据此判断开源模型做长任务智能体的可行性。
OpenAI 发布 GPT-5.5,官方称其为面向编码、研究和数据分析等复杂任务打造的模型,可跨工具使用。目前公开信息仅为摘要,未披露参数、上下文窗口或评测数据。
推荐理由:OpenAI 官方发布 GPT-5.5,读者可据此了解新模型面向编码、研究与数据分析等复杂任务的定位。