ChatGPT 工作区智能体(Workspace agents)
OpenAI 介绍如何在 ChatGPT 中构建和使用工作区智能体(workspace agents),用于自动化重复性工作流、连接工具并简化团队运营。
OpenAI 介绍如何在 ChatGPT 中构建和使用工作区智能体(workspace agents),用于自动化重复性工作流、连接工具并简化团队运营。
OpenAI 在 ChatGPT 中推出工作区智能体(workspace agents),由 Codex 驱动,可自动化复杂工作流并在云端运行。官方称其能帮助团队跨工具安全地扩展工作。
推荐理由:OpenAI 官方公布 ChatGPT 工作区智能体的定位与运行方式,可据此了解其自动化工作流的切入点。
OpenAI 发布 Privacy Filter,一款用于检测和脱敏文本中个人身份信息(PII)的开放权重模型,官方称其准确率达到 SOTA。目前公开信息仅为摘要,未披露模型规模、许可协议与开放入口。
推荐理由:OpenAI 开源一款用于检测和脱敏文本 PII 的开放权重模型,可了解其在隐私合规场景的定位。
Google Research 在 ICLR 论文中提出智能体记忆框架 ReasoningBank,从成功和失败经验中提炼高层推理模式,用于测试时自我进化。
推荐理由:Google Research 的 ICLR 论文提出从成功与失败经验中提炼推理记忆的框架,并给出 WebArena 与 SWE-Bench-Verified 上的对比数据。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,帮助企业规模化采用前沿 AI。合作方将获得包括 Gemini 系列在内的前沿模型早期访问权,并直接对接 Google DeepMind 技术团队,聚焦金融、制造、零售、媒体娱乐等行业的智能体转型。目前仅 25% 的组织成功将 AI 规模化投入生产。
OpenAI 发布 ChatGPT Images 2.0,改进了文字渲染、多语言支持和视觉推理能力。原文同时提到可查看 Images 2.5 的新变化。
推荐理由:官方给出图像生成能力的三项具体改进方向,可据此判断多语言与文字渲染场景的可用性变化。
Hugging Face 发布 QIMMA قِمّة 阿拉伯语 LLM 排行榜,在评测模型前先对基准做质量验证。该榜单整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖文化、STEM、法律、医疗、安全、诗歌文学与代码 7 大领域,其中 99% 为原生阿拉伯语内容,并首次在阿拉伯语排行榜中引入代码评测。
Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后 AI 网络安全格局,指出 Mythos 的关键不在模型本身,而在于其嵌入的系统——大算力、软件数据训练、漏洞探测与修补脚手架及一定自主性共同构成的能力配方。文章认为开放代码与工具可分散检测、验证、协调、补丁传播四个阶段,缩小攻防能力差距,并主张采用半自主 AI 智能体在组织内部署防御。
OpenAI 推出 Codex Labs,并与埃森哲、普华永道、Infosys 等合作,帮助企业在软件开发全生命周期中部署和扩展 Codex。OpenAI 同时公布 Codex 周活跃用户达到 400 万。
推荐理由:OpenAI 公布 Codex 周活 400 万并联合埃森哲、普华永道等推企业落地服务,可观察编码智能体的企业采用路径。
伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度避免高维视觉模型中的脆弱"状态-输入"梯度,使基于学习动力学(世界模型)的长时程规划变得可行。该工作与 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun 和 Amir Bar 合作完成。
凯悦(Hyatt)在全球员工队伍中部署 ChatGPT Enterprise,并使用 GPT-5.4 和 Codex 提升生产力、运营效率与宾客体验。OpenAI 为凯悦的 AI 落地提供支持。
Google Research 提出推理优先的合成数据生成框架 Simula,将数据集生成重构为机制设计问题,通过全局多样化、局部多样化、复杂化和双评审质量检查四个步骤,独立控制覆盖度、复杂度与质量。
Google Research 提出 MoGen(Neuronal Morphology Generation),用 PointInfinity 点云流匹配模型生成合成神经元形状,为 PATHFINDER 重建模型补充训练数据,使小鼠轴突重建误差降低 4.4%,主要来自合并错误的减少。
OpenAI 更新 macOS 和 Windows 版 Codex 应用,新增电脑操作、应用内浏览、图像生成、记忆和插件功能,用于加速开发者工作流。
推荐理由:原文列出 Codex 桌面端新增的电脑操作、应用内浏览、图像生成、记忆与插件,读者可据此判断开发工作流的变化。
OpenAI 发布 GPT-Rosalind,一款面向生命科学的前沿推理模型。该模型用于加速药物发现、基因组分析、蛋白质推理和科研工作流。
推荐理由:OpenAI 发布面向生命科学的前沿推理模型,读者可了解其在药物发现与基因组分析等科研流程中的定位。
Hugging Face 将 RLVE 框架从单轮推理题扩展到多轮、工具增强的电商对话,推出 EcomRLVE-GYM,包含产品发现、替代品、购物车构建、退货、订单追踪、政策问答、组合规划和多意图旅程 8 个可验证环境,每个环境配有程序化问题生成、12 轴难度课程和算法可验证奖励。
Hugging Face 发布一个 Skill 和配套测试框架,帮助贡献者把 transformers 中的语言模型移植到 mlx-lm,使模型加入 transformers 后能较快在 MLX 上可用。
推荐理由:原文给出可复用的 Skill 与独立测试框架,读者可了解如何让智能体产出可被维护者接受的模型移植 PR。
OpenAI 面向网络安全领域推出 Trusted Access for Cyber,领先安全公司与大型企业已加入,使用 GPT-5.4-Cyber 强化全球网络防御。OpenAI 同时提供 1000 万美元 API 资助,支持该生态建设。
Sentence Transformers 现已支持训练和微调多模态嵌入与 Reranker 模型,作者以 Qwen/Qwen3-VL-Embedding-2B 微调视觉文档检索(VDR)为例,微调后 NDCG@10 从基线的 0.888 提升至 0.947,超过所有对比的现有 VDR 模型,包括参数量达其 4 倍的模型。
Google DeepMind 发布 Gemini 3.1 Flash TTS,称其在可控性、表达力和语音质量上均有提升,并引入可用自然语言指令控制语气、语速和表达方式的音频标签。
推荐理由:官方给出新语音模型的音频标签控制方式、Elo 分数与多语言覆盖,可据此判断表达力控制的实际粒度。
Hugging Face 发布 VAKRA,一个面向企业级环境的工具接地可执行基准,用于评估 AI 智能体的组合推理与多步工作流执行能力。该基准提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择与多跳推理四类任务,模型整体表现不佳。博客进一步分析了不同任务上观察到的失败模式。
OpenAI 更新 Agents SDK,新增原生沙箱执行和模型原生 harness,帮助开发者在文件与工具之间构建安全、长时间运行的智能体。
推荐理由:官方给出 Agents SDK 的两项能力变化,读者可据此判断长时运行智能体的构建方式有何调整。
HCompany 发布 Chrome 扩展 HoloTab,让 Holo3 计算机操作模型直接在浏览器中自动完成网页任务,用户只需描述需求,智能体便自行导航界面、填写字段并做决策,无需任何配置或技术背景。HoloTab 支持 Routines 功能,用户录制一次操作过程(可边操作边口述),扩展会据此生成可重复运行或定时执行的例程。该扩展免费开放使用,已在 Chrome 应用商店上线。
推荐理由:HCompany 把此前发布的 Holo3 计算机操作模型封装成浏览器扩展,读者可了解其录制复用机制与零门槛定位。
OpenAI 扩展 Trusted Access for Cyber 计划,向经过审核的防御者推出 GPT-5.4-Cyber,并随 AI 网络安全能力提升强化防护措施。
Google 在 Google Labs 上线研究实验 Vantage,用生成式 AI 构建模拟对话环境,评估高中与大学生的问题解决、协作等未来技能,目前提供英文版并可注册。Vantage 与纽约大学合作开发,由 Executive LLM 动态引导对话、AI Evaluator 依据评分量表打分,188 名 18-25 岁美国测试者的研究显示其评分与人类专家一致度接近专家间一致度。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,重点增强空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。
推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并首次加入仪表读数能力,可据此判断机器人在设施巡检场景的可用性。
Cloudflare 将 OpenAI 的 GPT-5.4 和 Codex 引入 Agent Cloud,让企业能够构建、部署并规模化运行面向真实任务的 AI 智能体。该集成强调速度与安全性,用于支撑企业级智能体工作流。
OpenAI 介绍如何用 ChatGPT 辅助写作,完成内容的起草、修改与润色,并保持清晰的结构、语气和意图。
OpenAI 发布提示词基础指南,讲解如何写出清晰有效的提示词,从而让 ChatGPT 给出更好、更有用的回答。
OpenAI 发布指南,介绍如何用 ChatGPT 做研究:收集来源、分析信息,并生成结构化、带引用的洞察。内容围绕研究工作流展开,未披露新模型版本或具体性能数据。
OpenAI 介绍如何用 ChatGPT 探索数据集、生成洞察并创建可视化,进而把分析结果转化为可执行的决策。
OpenAI 发布指南,介绍在使用 ChatGPT 等工具时兼顾安全、准确与透明的负责任 AI 使用最佳实践。内容面向用户,强调安全、准确性和透明度三方面的规范做法。
OpenAI 发布面向财务团队的 ChatGPT 实用工作流,覆盖财务分析、报告、规划与决策沟通四类场景。内容聚焦可直接落地的操作方式,帮助财务人员用 ChatGPT 完成从数据处理到汇报输出的日常工作。
ChatGPT 的 projects 功能可用于组织对话、文件与指令,管理持续推进的工作并提升协作效率。该功能帮助用户把相关聊天与资料归入同一项目,从而更有效地管理进行中的任务。
OpenAI 发文介绍临床医生如何使用 ChatGPT 支持诊断、文书撰写与患者护理。文中称相关 AI 工具具备安全性并符合 HIPAA 合规要求。
OpenAI 发布面向金融服务的 AI 资源集合,包含提示词包、GPTs、指南和工具,帮助机构安全部署并规模化应用 AI。
OpenAI 发布指南,介绍如何用 ChatGPT 的搜索和深度研究(deep research)功能做研究,以获取最新信息、分析来源并生成结构化洞察。
OpenAI 介绍营销团队如何用 ChatGPT 规划营销活动、创作内容、分析效果,并把洞察转化为行动。文章围绕实际 AI 工作流展开,未披露新模型版本或具体功能参数。
OpenAI 介绍管理者如何用 ChatGPT 准备沟通、撰写清晰反馈、保持条理并提升团队效能。内容涵盖对话准备、反馈撰写与日常组织等场景。
OpenAI 展示了旗下 ChatGPT、Codex 和 API 等产品在真实场景中的应用方式,覆盖工作、开发与日常任务。内容围绕这些产品如何将 AI 带入实际使用展开。