Singular Bank 用 ChatGPT 和 Codex 打造内部助手 Singularity
Singular Bank 基于 ChatGPT 和 Codex 构建了内部助手 Singularity,帮助银行家在会议准备、投资组合分析和后续跟进上每天节省 60–90 分钟。
Singular Bank 基于 ChatGPT 和 Codex 构建了内部助手 Singularity,帮助银行家在会议准备、投资组合分析和后续跟进上每天节省 60–90 分钟。
OpenAI 与 PwC 达成合作,帮助企业用 AI 智能体自动化财务工作流、改进预测、强化管控并推动 CFO 职能现代化。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗的“三方照护”模式。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,优于医生常用的两款 AI 系统;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体仍更强。
推荐理由:DeepMind 公开医疗 AI 智能体的多模态评测细节,读者可据此了解 AI 在临床问诊中已达标与仍欠缺的具体环节。
Google Research 汇总了科学家使用 Empirical Research Assistance(ERA)的四类实践:公共卫生领域,团队每周向 CDC 的流感。
推荐理由:Google 官方汇总 ERA 在流行病预测、宇宙学、碳监测与神经科学四类真实科研任务中的使用结果,可了解 AI 辅助科研的落地边界。
OpenAI 的 GPT 模型、Codex 和 Managed Agents 现已在 AWS 上可用,企业可在自己的 AWS 环境中构建安全的 AI 应用。
推荐理由:OpenAI 把 GPT 模型、Codex 与 Managed Agents 接入 AWS,读者可据此判断企业现有云环境能否直接落地。
Mistral AI 发布 Workflows 公开预览,定位为企业 AI 的编排层,提供持久化执行、可观测性和容错能力,用于把 AI 流程从概念验证推进到生产。
推荐理由:原文给出企业级 AI 编排层的持久化执行、可观测与人工审批能力,以及控制面与数据面分离的部署方式,可供评估生产落地路径。
Choco 利用 OpenAI API 构建 AI 智能体,实现食品分销流程自动化,以提升生产力并推动业务增长。这是 OpenAI 发布的一则客户案例,聚焦 AI 在真实场景中的落地成效。
OpenAI 发布开源规范 Symphony,用于 Codex 编排,可把 issue tracker 变成常驻的智能体系统。该规范旨在提升工程产出并减少上下文切换。
DeepSeek 发布 V4,两个 MoE 检查点上线 Hub:DeepSeek-V4-Pro 总参数 1.6T、激活 49B,DeepSeek-V4-Flash 总参数 284B、激活 13B,均支持 1M token 上下文窗口。
推荐理由:原文给出 V4 在长上下文推理成本与智能体后训练上的具体设计,可据此判断开源模型做长任务智能体的可行性。
OpenAI 发布 GPT-5.5,官方称其为面向编码、研究和数据分析等复杂任务打造的模型,可跨工具使用。目前公开信息仅为摘要,未披露参数、上下文窗口或评测数据。
推荐理由:OpenAI 官方发布 GPT-5.5,读者可据此了解新模型面向编码、研究与数据分析等复杂任务的定位。
Hugging Face 发布教程,讲解如何在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI 功能,并以自家 Gemma 4 浏览器助手扩展为参考实现。
推荐理由:以官方发布的 Gemma 4 浏览器扩展为参照,拆解 MV3 下本地模型托管、消息契约与工具调用循环的架构取舍。
OpenAI 详解 Codex 智能体循环如何借助 WebSockets 与连接级缓存降低 API 开销并改善模型延迟。
OpenAI 介绍如何在 ChatGPT 中构建和使用工作区智能体(workspace agents),用于自动化重复性工作流、连接工具并简化团队运营。
OpenAI 在 ChatGPT 中推出工作区智能体(workspace agents),由 Codex 驱动,可自动化复杂工作流并在云端运行。官方称其能帮助团队跨工具安全地扩展工作。
推荐理由:OpenAI 官方公布 ChatGPT 工作区智能体的定位与运行方式,可据此了解其自动化工作流的切入点。
Google Research 在 ICLR 论文中提出智能体记忆框架 ReasoningBank,从成功和失败经验中提炼高层推理模式,用于测试时自我进化。
推荐理由:Google Research 的 ICLR 论文提出从成功与失败经验中提炼推理记忆的框架,并给出 WebArena 与 SWE-Bench-Verified 上的对比数据。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,帮助企业规模化采用前沿 AI。合作方将获得包括 Gemini 系列在内的前沿模型早期访问权,并直接对接 Google DeepMind 技术团队,聚焦金融、制造、零售、媒体娱乐等行业的智能体转型。目前仅 25% 的组织成功将 AI 规模化投入生产。
Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后 AI 网络安全格局,指出 Mythos 的关键不在模型本身,而在于其嵌入的系统——大算力、软件数据训练、漏洞探测与修补脚手架及一定自主性共同构成的能力配方。文章认为开放代码与工具可分散检测、验证、协调、补丁传播四个阶段,缩小攻防能力差距,并主张采用半自主 AI 智能体在组织内部署防御。
伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度避免高维视觉模型中的脆弱"状态-输入"梯度,使基于学习动力学(世界模型)的长时程规划变得可行。该工作与 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun 和 Amir Bar 合作完成。
OpenAI 更新 macOS 和 Windows 版 Codex 应用,新增电脑操作、应用内浏览、图像生成、记忆和插件功能,用于加速开发者工作流。
推荐理由:原文列出 Codex 桌面端新增的电脑操作、应用内浏览、图像生成、记忆与插件,读者可据此判断开发工作流的变化。
Hugging Face 将 RLVE 框架从单轮推理题扩展到多轮、工具增强的电商对话,推出 EcomRLVE-GYM,包含产品发现、替代品、购物车构建、退货、订单追踪、政策问答、组合规划和多意图旅程 8 个可验证环境,每个环境配有程序化问题生成、12 轴难度课程和算法可验证奖励。
Hugging Face 发布 VAKRA,一个面向企业级环境的工具接地可执行基准,用于评估 AI 智能体的组合推理与多步工作流执行能力。该基准提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择与多跳推理四类任务,模型整体表现不佳。博客进一步分析了不同任务上观察到的失败模式。
OpenAI 更新 Agents SDK,新增原生沙箱执行和模型原生 harness,帮助开发者在文件与工具之间构建安全、长时间运行的智能体。
推荐理由:官方给出 Agents SDK 的两项能力变化,读者可据此判断长时运行智能体的构建方式有何调整。
HCompany 发布 Chrome 扩展 HoloTab,让 Holo3 计算机操作模型直接在浏览器中自动完成网页任务,用户只需描述需求,智能体便自行导航界面、填写字段并做决策,无需任何配置或技术背景。HoloTab 支持 Routines 功能,用户录制一次操作过程(可边操作边口述),扩展会据此生成可重复运行或定时执行的例程。该扩展免费开放使用,已在 Chrome 应用商店上线。
推荐理由:HCompany 把此前发布的 Holo3 计算机操作模型封装成浏览器扩展,读者可了解其录制复用机制与零门槛定位。
Google 在 Google Labs 上线研究实验 Vantage,用生成式 AI 构建模拟对话环境,评估高中与大学生的问题解决、协作等未来技能,目前提供英文版并可注册。Vantage 与纽约大学合作开发,由 Executive LLM 动态引导对话、AI Evaluator 依据评分量表打分,188 名 18-25 岁美国测试者的研究显示其评分与人类专家一致度接近专家间一致度。
Cloudflare 将 OpenAI 的 GPT-5.4 和 Codex 引入 Agent Cloud,让企业能够构建、部署并规模化运行面向真实任务的 AI 智能体。该集成强调速度与安全性,用于支撑企业级智能体工作流。
OpenAI 发布 ChatGPT 技能使用指南,介绍如何创建和使用技能来构建可复用工作流、自动化重复性任务,并确保输出一致且高质量。
Google Research 推出 ConvApparel,一个包含 4000 多组人机多轮对话(近 15000 轮)的服饰购物领域数据集,用于量化 LLM 用户模拟器与真实人类行为的真实感差距。
Google 发布两款学术智能体:PaperVizAgent 负责生成论文配图,ScholarPeer 负责自动同行评审。PaperVizAgent 由检索、规划、风格、可视化、评审五个智能体协作,在 0-100 分评测中总分 60.2,超过 GPT-Image-1.5、Nano-Banana-Pro、Paper2Any,是唯一超过 50.0 人类基线的框架。
OpenAI 阐述了企业级 AI 的下一阶段,随着各行业采用加速,其企业产品线涵盖 Frontier、ChatGPT Enterprise、Codex 以及公司范围内的 AI 智能体。
Gradient Labs 基于 GPT-4.1 和 GPT-5.4 mini、nano 构建 AI 智能体,为每位银行客户提供 AI 客户经理,自动处理银行支持工作流。该方案主打低延迟与高可靠性。
Mistral AI 发布 Spaces CLI,可一条命令完成项目脚手架、开发环境启动与部署,内置 `spaces init`、`spaces dev` 等命令。该工具为每个交互式提示词提供对应的 flag 与 `-y` 参数,使 AI 智能体无需处理 ANSI 转义码即可自主操作,并在每次初始化时生成 context.json 与 AGENTS.md 供智能体读取项目上下文。
Google DeepMind 公布 AI 指针的实验性方案,由 Gemini 驱动,让指针理解用户指向的内容及其对用户的意义,并给出四条交互原则:保持工作流不中断、展示与说明、用「这个」和「那个」的简略表达、把像素变成可操作实体。
推荐理由:Google DeepMind 公开 AI 指针的四条交互原则,并说明其已进入 Chrome 与 Googlebook,读者可据此判断 AI 交互从提示词转向指向与语音的路径。
Anthropic 正在限制 Pro/Max 订阅者在开放智能体平台中使用 Claude 模型,Hugging Face 提出两条迁移路径:通过 Hugging Face Inference Providers 调用开源模型,或在本地硬件上运行开源模型。
推荐理由:Anthropic 收紧 Claude 在开放智能体平台的访问后,文章给出托管与本地两条迁移路径和具体配置命令。
Google 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR 的 XR Blocks 框架结合,把自然语言提示直接转成可运行的 Android XR 应用,官方称耗时在 60 秒以内。
推荐理由:Google 把 Gemini 与 XR Blocks 组合成自然语言生成 XR 应用的流程,并给出 VCXR60 初步评测数据,可据此判断 XR 原型开发门槛的变化。
ChatGPT 推出更丰富、更具视觉沉浸感的购物体验,由 Agentic Commerce Protocol 驱动,支持商品发现、并排对比和商家接入。
ServiceNow 在 Hugging Face 发布 EVA,一个面向对话式语音智能体的端到端评测框架,同时给出 EVA-A(准确性)和 EVA-X(体验)两个分数,并称是首个联合评估任务成功与会话体验的框架。
OpenAI 采用思维链监控(chain-of-thought monitoring)研究内部编程智能体的失准(misalignment)问题,通过分析真实部署场景来检测风险并强化 AI 安全保障措施。
Google Research 在 The Check Up 活动上公布医疗 AI 的多项进展,覆盖个性化健康、临床协作、开发者生态与公共卫生等方向。
推荐理由:Google Research 集中披露医疗 AI 从研究走向临床的多条进展,可了解其落地路径与合作方式。
Mistral AI 推出 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统。Forge 支持预训练、后训练和强化学习等阶段,可训练模型理解内部术语、代码库与流程,并支持 dense 与 MoE 架构及多模态输入。该产品面向智能体优先设计,Mistral Vibe 等自主智能体可用其微调模型、寻找最优超参数、调度任务并生成合成数据,企业还能通过内部评测与强化学习持续改进模型。
推荐理由:原文给出企业用自有数据训练前沿模型的产品定位与训练流程,可据此判断企业自建模型与智能体的落地路径。
H Company 发布 Holotron-12B,一个基于 NVIDIA Nemotron-Nano-2 VL 后训练的多模态计算机操作模型,现已上线 Hugging Face,采用 NVIDIA Open Model License。
推荐理由:原文给出模型来源、混合 SSM 架构与吞吐对比数据,读者可据此判断其在长上下文智能体场景的部署取舍。