OpenAI 发布可信第三方评估指南
OpenAI 分享第三方 AI 评估指南,覆盖如何评估前沿系统的模型能力、安全防护措施与评估有效性。
OpenAI 分享第三方 AI 评估指南,覆盖如何评估前沿系统的模型能力、安全防护措施与评估有效性。
Google Research 在 I/O 2026 上公布多项进展,包括面向科研的 Gemini for Science 工具套件、智能体开发平台 Google Antigravity 2.0,以及健康、天气预报、量子计算等方向的研究成果。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产,并强调对专有数据和 IP 的完全控制。
推荐理由:Mistral 一次性公布工业工程 AI 栈、Vibe 智能体升级与自建数据中心,可看到其企业级全栈布局。
Mistral 宣布将 Le Chat 升级为统一 AI 智能体 Vibe,同时覆盖工作与编码场景,原有对话、设置和订阅方案全部保留。
推荐理由:Mistral 把 Le Chat 升级为统一智能体 Vibe,读者可据此判断工作与编码两类长任务如何被同一入口承接。
Endava 借助 Codex 构建智能体组织,将需求分析周期从数周缩短至数小时,并加速软件交付。该案例展示了 Codex 在企业级软件工程流程中的落地方式。
Mistral AI 发布 Search Toolkit 公开预览版,这是一个用于构建 AI 应用生产级搜索管线的可组合框架,将数据摄取、检索和评测整合到共享接口下,开源并支持云端、本地和边缘部署。
推荐理由:原文给出检索管线的统一框架与内置评测指标,读者可据此判断自建 RAG 检索栈的整合成本。
OpenAI 发布前沿治理框架(Frontier Governance Framework),说明其 AI 安全、安保与风险管理实践如何与欧盟及加州正在成形的法规对齐。该框架聚焦于前沿模型的治理与合规衔接。
Google 为隐私分析服务推出零信任聚合方案,结合新型密码学聚合协议与 TEE,使设备只需单条消息即可安全提交数据,无需多轮在线交互。该协议可证明 Google 只能获得群体的匿名聚合洞察,原始个体数据即使在硬件保护范围内也不会被解密或重建,TEE 证明机制则向参与者验证协议按公开代码正确执行。
Mistral 宣布将 Emmi AI 并入公司,推出面向工业工程的物理 AI 能力,作为其企业解决方案中的新基础能力。该能力从几何与边界条件直接预测物理场,单次前向推理在单张 GPU 上以秒级完成,用于加速产品设计、工装工艺设计和实时数字孪生,合作方包括 ASML、Airbus、Safran 和 Siemens Energy。
推荐理由:Mistral 把物理仿真 AI 纳入企业平台,读者可据此判断工业设计流程的算力与迭代节奏会如何变化。
Mistral 收购 Emmi AI,并加倍投入面向航空航天、汽车、半导体和能源等行业的基础 Physics AI 研究。其已发布成果包括 AB-UPT,可在单张 GPU 上处理 9M 表面和 140M 体积网格的原始几何数据而无需重新划分网格,以及面向大型多物理过程的端到端深度学习代理模型 NeuralDEM。
Cisco 与 OpenAI 正用 Codex 重塑企业工程,帮助 Cisco 规模化 AI 原生开发、加速 AI Defense 工作并自动化缺陷修复。
OpenAI、Thrive 和 Crete 用 Codex 构建了一个可自我改进的税务智能体,用于自动完成报税、提升准确性并加速工作流。该方案展示了 Codex 在税务申报自动化场景中的落地方式。
OpenAI 公布 2026 年选举支持方案,涵盖可靠信息、网络防御、AI 透明度、滥用防护与偏见监测五方面。该方案面向 2026 年选举场景,具体措施细节尚未在文中展开。
Hugging Face 发布教程,介绍如何让 Reachy Mini 完全本地运行语音对话,无需云端、API key,音频不出本机。
推荐理由:Hugging Face 给出 Reachy Mini 全本地语音对话的完整级联方案与可替换组件清单,读者可据此复现并自行替换各环节模型。
Hugging Face 在 TRL 中落地增量权重同步(Delta Weight Sync):只把 RL 优化器步之间真正变化的 bf16 权重编码成稀疏 safetensors 文件上传到 Hub Bucket,再由 vLLM 拉取应用。
推荐理由:TRL 把稀疏增量权重同步做成了可 pip 安装的实现,读者可据此判断跨机房异步 RL 训练的部署成本。
Warp 正基于 GPT-5.5 及 OpenAI 模型,在本地、云端和开源开发流程中协调多个编码智能体。该工具将 GPT-5.5 用于跨环境的编码智能体调度,以支持开源协作开发。
OpenAI 新研究显示,400 万美国人正使用 ChatGPT 创办、运营和扩展小企业,AI 降低了创业成本。
Hugging Face 发布 AI 智能体术语表,重点厘清常被混用的 harness 与 scaffold:scaffold 是定义模型行为的系统提示词、工具描述与上下文管理层,harness 则是调用模型、处理工具调用并决定何时停止的执行层,社区常用 Agent = Model + Harness 概括。
OpenAI 与 Grupo Folha 和 Grupo UOL 宣布达成战略内容合作,把可信的巴西新闻内容引入 ChatGPT,并附带来源标注与透明度信息。此次合作旨在扩大用户对新闻内容的获取渠道。
Mistral AI 宣布已达成收购 Physics AI 公司 Emmi AI 的最终协议,以强化其面向工业企业的 AI 转型服务能力。Emmi AI 总部位于奥地利,专注物理 AI 与大型工程模型,可把多日计算替换为实时仿真并构建数字孪生;其联合创始人及 30 多名研究人员和工程师将于 5 月加入 Mistral 的 Science 与 Applied AI 团队。
推荐理由:Mistral 通过收购补齐 Physics AI 能力,读者可了解其面向工业工程与科学计算的布局方向。
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密模型,以修改版 MIT 许可开放权重,成为 Mistral Vibe 和 Le Chat 的默认模型,并支撑 Vibe 的云端远程编码智能体与 Le Chat 的 Work 模式预览。
推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 权重,读者可据此判断自托管编码智能体的可行边界。
Mistral 在 Studio 发布 Connectors(公开预览),内置连接器和自定义 MCP 均可通过 API/SDK 用于所有模型与智能体调用。连接器以 MCP 协议打包为可复用实体,集中注册后可在 LeChat 和 AI Studio 中使用,并支持程序化创建、修改、列出和删除。
推荐理由:原文给出连接器注册、直接工具调用与人工审批三段能力,读者可据此判断企业级 Agent 集成层的落地方式。
OpenAI 在 2026 年 Gartner 企业级 AI 编程智能体魔力象限中被评为领导者,旗下 Codex 因创新能力和企业级规模部署获得认可。
Virgin Atlantic 借助 Codex 在固定的假日出行截止期限前完成移动应用改版,实现接近全覆盖的单元测试和零 P1 缺陷。
Google DeepMind 在亚太地区启动首届加速器计划,聚焦“AI for the Planet”,面向该地区初创公司、研究团队和非营利组织,为期三个月。入选机构将获得专家指导,以及 Google AI 专家协助将前沿 AI 与科学 AI 模型集成到项目或产品中,覆盖自然、气候、农业、能源等领域。计划以在新加坡举行的线下 bootcamp 启动,现已开放注册意向。
AdventHealth 正在使用 ChatGPT for Healthcare 简化工作流程、减轻行政负担,把更多时间还给患者护理。
OpenAI 推进 Education for Countries 计划,通过新增合作伙伴关系、教师培训和工具,扩大 AI 在学校中的应用,以改善全球学习成果。
OpenAI 称其模型解决了已有 80 年历史的单位距离问题,推翻离散几何中的一项重要猜想,被视为 AI 驱动数学的一个里程碑。
推荐理由:OpenAI 模型推翻离散几何中悬置 80 年的核心猜想,可观察 AI 在数学证明上的能力边界。
Ramp 工程师借助 Codex 与 GPT-5.5 进行代码审查并推进改进,将实质性反馈的获取时间从数小时缩短至数分钟。
OpenAI 推出 OpenAI for Singapore,与新加坡达成一项多年期 AI 合作,旨在扩大 AI 部署、培养本地人才,并支持企业及公共服务应用 AI。
Hugging Face 发布 OlmoEarth v1.1 地球观测模型系列,通过将 Sentinel-2 各分辨率合并为单一 token 缩短序列长度,在保持 v1 性能的同时将计算成本最多降低 3 倍。该系列包含 Base、Tiny 和 Nano 三种规模,权重与训练代码已开放。
Google 宣布把基于 Gemini 的科研工具 Empirical Research Assistance(ERA)开放给科学家使用,相关论文同日发表于 Nature。
推荐理由:Google 把 ERA 从 Nature 论文推进到可申请使用的工具,并给出八个跨学科应用案例,可据此判断科研编码自动化的落地边界。
OpenAI 推进 AI 内容溯源,采用 Content Credentials、SynthID 并推出验证工具,帮助人们识别和信任 AI 生成媒体。
Hugging Face 发布 Ettin Reranker 系列六款 Sentence Transformers CrossEncoder 重排序模型,参数规模从 17m 到 1b,基于 Ettin ModernBERT 编码器构建。
Google DeepMind 介绍其 Co-Scientist 正被用于细胞衰老逆转研究,帮助生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室筛选基因通路。Co-Scientist 扫描数万篇论文后提出 20 多个新的候选基因因子,实验室测试验证了其中几个假设,成功让细胞进入更年轻状态并改善整体功能。它还能将原本需要长达六个月的筛选数据分析缩短到几天。
推荐理由:原文给出 Co-Scientist 在衰老研究中的具体产出与耗时对比,可了解 AI 智能体参与科研假设生成的实际方式。
PaddleOCR 3.5 发布,支持将 Hugging Face Transformers 作为推理后端,开发者可通过 engine="transformers" 运行 PP-OCRv5、PaddleOCR-VL 1.5 等模型。
OpenAI 与 Dell 达成合作,将 Codex 引入混合云和本地部署环境,帮助企业在数据与工作流中安全部署 AI 编程智能体。
Google DeepMind 在 Project Genie 中上线 Street View 真实影像锚定能力,用户可选取美国境内地点并叠加风格,生成以真实地点为起点的可交互世界。
推荐理由:Google DeepMind 把 Genie 的世界模型与 Street View 真实影像打通,读者可据此判断世界模型从纯生成走向现实锚定的路径。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言多轮编辑视频。
推荐理由:Gemini Omni 把多模态输入与对话式视频编辑结合,读者可据此判断视频生成工作流的变化方向。
Google DeepMind 推出 Gemini for Science,包含 Google Labs 上三个实验性工具:基于 Co-Scientist 的 Hypothesis Generation。
推荐理由:原文给出三类科学智能体实验工具与 Science Skills 的开放入口,可据此判断科研工作流的可迁移用法。