OpenAI 与 Broadcom 达成战略合作,将部署 10 吉瓦 OpenAI 自研 AI 加速器
OpenAI 与 Broadcom 宣布多年期战略合作,将部署 10 吉瓦由 OpenAI 设计的 AI 加速器。双方将共同开发下一代系统与以太网方案,目标是在 2029 年前支撑可扩展且高能效的 AI 基础设施。
推荐理由:OpenAI 与 Broadcom 联合设计加速器并规划 10 吉瓦部署,可观察自研芯片与算力基础设施的走向。
OpenAI 与 Broadcom 宣布多年期战略合作,将部署 10 吉瓦由 OpenAI 设计的 AI 加速器。双方将共同开发下一代系统与以太网方案,目标是在 2029 年前支撑可扩展且高能效的 AI 基础设施。
推荐理由:OpenAI 与 Broadcom 联合设计加速器并规划 10 吉瓦部署,可观察自研芯片与算力基础设施的走向。
Arm 将于 10 月 22-23 日参展 PyTorch Conference,展示基于 PyTorch 和 ExecuTorch 的 AI 应用开发与部署方案。
OpenAI Codex 现已正式可用,面向开发者新增 Slack 集成、Codex SDK,以及用量看板和工作区管理等管理工具。官方称这些功能让 Codex 更易使用,也更容易在规模化场景下管理。
推荐理由:Codex 从预览走向正式可用,新增 Slack 集成、SDK 与管理后台,读者可据此判断团队规模化使用的门槛变化。
AMD 与 OpenAI 宣布达成多年战略合作,将部署 6 吉瓦 AMD Instinct GPU,用于支撑 OpenAI 的下一代 AI 基础设施。其中首批 1 吉瓦将于 2026 年开始部署。
推荐理由:OpenAI 与 AMD 达成多年算力合作,读者可据此了解其下一代 AI 基础设施的芯片供应布局。
OpenAI 发布 AgentKit、扩展后的 Evals 能力以及面向智能体的强化微调(RFT),用于帮助开发者更快从原型走向生产。官方称这批工具覆盖智能体开发、评估与微调环节。
推荐理由:OpenAI 官方发布面向智能体开发的工具组合,读者可据此了解其从原型到生产的工具链布局。
Hugging Face 博客发布三部分系列的第一篇,记录如何将 RedNote 的 3B OCR 模型 dots.ocr 转换为可在 Apple 设备端运行的 Core ML 模型。
OpenAI 构建了一款内部 AI 销售助手,用于自动化客户调研、会议准备、产品知识查询和客户跟进。该助手旨在提升销售团队的生产力与客户成功率。
OpenAI 构建了一套合同数据提取系统,缩短了处理周期,让团队更便捷地获取所需细节。该系统将合同转为可搜索数据,提升了数据访问效率。
Hugging Face 用 OpenVINO.GenAI 在 Intel Core Ultra 上加速 Qwen3-8B,以 Qwen3-0.6B 作草稿模型进行投机解码,生成速度提升约 1.3 倍。
针对 Vibe Coding 游戏项目随规模增长而失控的问题,作者推出 VibeGame——一个基于 three.js、rapier 和 bitecs 构建的高层声明式游戏引擎,专为 AI 辅助游戏开发设计。
Hugging Face 的 Swift 库 swift-transformers 发布 1.0,为 Apple 平台本地模型推理提供 Tokenizers、Hub 及 Core ML 模型与生成模块。
OpenAI、Oracle 和 SoftBank 宣布为 Stargate 新增五个 AI 数据中心站点,推进一项 5000 亿美元、10 吉瓦的美国基础设施扩建计划。该计划旨在支撑下一代 AI,并创造数万个就业岗位。
推荐理由:Stargate 新增五个站点,读者可了解 5000 亿美元、10 吉瓦级 AI 数据中心建设的推进节奏。
OpenAI 与 NVIDIA 宣布战略合作,将部署 10 吉瓦由 NVIDIA 系统驱动的 AI 数据中心,首期于 2026 年启动。
推荐理由:OpenAI 与 NVIDIA 的 10 吉瓦算力合作给出了规模与首期时间点,可据此观察前沿模型训练算力的供给节奏。
Hugging Face 发布 SyGra,一个面向 LLM 和 SLM 的低代码/无代码数据构建框架,支持从 Q&A、SFT 到 DPO 偏好对、推理增强、多语言转换等数据集生成与转换。SyGra 提供 Python 库,兼容 vLLM、Hugging Face TGI、Triton、Ollama 等多种推理后端,可减少人工数据整理与工程投入。
Hugging Face Hub 新增 Scaleway 为 Inference Provider,用户可直接在模型页调用 gpt-oss、Qwen3、DeepSeek R1、Gemma 3 等开源模型。
Hugging Face Hub 新增 Public AI 为 Inference Provider,用户可直接调用 Swiss AI Initiative、AI Singapore 等机构的公共与主权模型。
Hugging Face 发布博客,介绍为支持 OpenAI gpt-oss 系列而在 transformers 中做的多项升级,包括可从 Hub 下载的零构建 Kernel、MXFP4 量化、张量并行、专家并行、动态滑动窗口层与缓存、连续批处理与 Paged Attention,以及更快的模型加载。
推荐理由:Hugging Face 官方拆解了为 gpt-oss 引入 transformers 的七项工程改动,可据此了解量化、并行与缓存优化的落地方式。
SafetyKit 借助 OpenAI GPT-5 提升内容审核与合规执行能力,在准确性上超越传统安全系统。该方案用于扩展风险智能体,覆盖内容审核与合规场景。
Mistral AI 为 Le Chat 推出 Memories(beta),采用自动保存、智能召回并始终显示来源链接的混合记忆方案。用户可随时关闭记忆、开启不使用记忆的隐身对话、编辑或删除单条记忆,并支持导出与导入,实现记忆的可移植与互操作。同步上线的 Memory Insights 可基于用户自身数据提示记忆趋势与摘要,后续将支持记忆分类、即时遗忘和更清晰的调用记录。
Mistral 在 Le Chat 中发布 20+ 个基于 MCP 的安全连接器目录(beta),覆盖数据、生产力、开发、自动化与商务等类别,支持接入 Databricks、Snowflake、GitHub、Atlassian、Asana、Outlook、Box、Stripe、Zapier 等工具,并可添加自定义 MCP 连接器或连接任意远程 MCP 服务器。
推荐理由:官方给出连接器目录与记忆功能的开放范围,读者可据此判断企业工作流接入的可行路径。
Hugging Face 介绍在 ZeroGPU Spaces 中使用 PyTorch 提前编译(AoT)的方法,通过 spaces 包的 aoti_capture、aoti_compile 和 aoti_apply 等接口,把模型编译一次后即时重载,避免 torch.compile 在短生命周期进程中反复编译。
Hugging Face 发布 kernel-builder 库,让开发者可在本地开发自定义 CUDA kernel,再为多种架构构建并发布到 Hugging Face Hub 供他人通过 get_kernel 直接调用。
Arm 与 ExecuTorch 0.7 beta 将默认启用 KleidiAI,为基于最新 Arm CPU 架构的设备以及大量旧款手机带来自动加速,Android 与跨平台开发者无需改动代码即可通过 ExecuTorch 和 XNNPack 获得优化。
Arm 发布面向图形与游戏开发者的 AI 超分方案 Neural Super Sampling(NSS),可在移动 GPU 的 Neural Accelerators 上实时运行。
Hugging Face 在 Accelerate 中联合 Axolotl 集成了 ND-Parallel 训练方案,可通过 ParallelismConfig 类自由组合数据并行、FSDP、张量并行与上下文并行策略。
Hugging Face 的 TRL 新增面向视觉语言模型的对齐能力,包括混合偏好优化 MPO、多模态 GRPO 以及 Qwen 提出的 GSPO,并扩展 RLOO 与 Online DPO 支持 VLM。
推荐理由:TRL 把 MPO、GRPO、GSPO 等对齐方法扩展到视觉语言模型,并给出可直接运行的训练脚本与 notebook。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开源权重语言模型,采用 Apache 2.0 许可。官方称这两款模型在推理任务上优于同规模开源模型,具备较强的工具调用能力,并针对消费级硬件的高效部署做了优化。
推荐理由:OpenAI 开源两款权重模型并给出尺寸与许可,读者可据此判断消费级硬件上的部署与推理选择。
NVIDIA 的 AI-Q Blueprint 在 DeepResearch Bench 的 Hugging Face "LLM with Search" 榜单上以 40.52 分登顶,成为得分最高的全开源许可方案。
Mistral 用 LoRA 微调 Pixtral-12B,在 Aerial Image Dataset(AID)卫星图像分类任务上显著优于基座模型。基座模型在 Playground、Stadium 等易混类别上会误判并偶发幻觉出不存在的类别名,微调后分类更准确。整个流程可通过 Mistral 微调 API 或 LaPlateforme UI 完成,无需大量超参数调优。
OpenAI 在 OpenAI for Countries 计划下启动 Stargate Norway,这是其在欧洲的首个 AI 数据中心计划。Stargate 是 OpenAI 的整体基础设施平台,也是其长期愿景的关键部分。
Mistral AI 发布 Codestral 25.08 代码模型,并推出覆盖补全、语义检索与智能体工作流的企业级编码栈。Codestral 25.08 相比前代补全接受率提升 30%、建议后保留代码增加 10%、失控生成减少 50%,支持云、VPC 与本地部署。
推荐理由:Mistral 官方给出编码栈各组件的能力数字与私有化部署路径,可据此判断企业自建编码助手的可行边界。
Intercom 分享了构建可扩展 AI 平台的三条经验,涵盖评估体系与架构设计,目标是引领客户支持的未来。内容围绕如何将 AI 能力沉淀为可持续的竞争优势展开。
Hugging Face 官方 CLI 从 huggingface-cli 正式更名为 hf,命令按资源分组为 hf auth、hf cache、hf repo 等,并保留 hf upload、hf download 在根层级。
PyArrow 和 Pandas 现已支持 Parquet 内容定义分块(CDC),可在 Hugging Face 的 Xet 存储层上对 Parquet 文件高效去重,只上传或下载发生变化的 chunk。
Hugging Face 发布针对 Flux.1-Dev 的 LoRA 推理优化配方,结合 Flash Attention 3、torch.compile 与 FP8 量化,在 H100 上相比基线实现 2.23 倍加速。
推荐理由:原文给出可复用的 LoRA 推理优化配方与实测延迟数据,读者可据此判断热切换与量化在自有硬件上的取舍。
Mistral AI 联合 Carbone 4 和法国生态转型署(ADEME)完成首个 AI 模型全生命周期分析,并公开 Mistral Large 2 的环境足迹:截至 2025 年 1 月,训练加 18 个月使用共产生 20.4 ktCO₂e、消耗 281 000 m³ 水和 660 kg Sb eq。
NVIDIA 宣布通过 NIM 推理微服务在 Hugging Face 上解锁超过 10 万个 LLM 的快速可靠部署。NIM 现在提供单个 Docker 容器,可部署由 TensorRT-LLM、vLLM 和 SGLang 支持的多种 LLM,并自动完成模型格式识别、架构与量化格式检测、后端选择和性能配置,无需手动调优。
推荐理由:NIM 用单个容器自动识别模型格式与量化方式并选择推理后端,读者可据此判断多模型部署流程能简化到什么程度。
Gradio 5.38.0 为 MCP Server 带来五项改进:新增 "File Upload" MCP server 让智能体直接上传文件,支持实时进度通知,并可通过 gr.load_openapi 一行代码将 OpenAPI 规范转为 MCP 工具。此外新增 gr.Header 类型自动提取认证请求头,并支持用 api_description 参数自定义工具描述。
Hugging Face 宣布 Hub 存储从 Git LFS 迁移到 Xet,6 个月内已有 50 万个仓库、20 PB 数据完成迁移,超过 100 万用户在使用 Xet。迁移依靠 Git LFS Bridge 和后台迁移流程实现,旧版客户端无需更换工作流即可继续上传下载。从本月起 Xet 将向所有用户开放,现有仓库会自动迁移,新建仓库默认启用 Xet,后续还将开源 Xet 协议及整套基础设施。
推荐理由:Hugging Face 官方复盘 Hub 从 Git LFS 迁移到 Xet 的工程细节,可看到大规模存储迁移如何做到对用户零打扰。
Hugging Face 发布 ScreenEnv,一个可在 Docker 容器中创建隔离 Ubuntu 桌面环境的 Python 库,用于测试和部署 GUI 智能体(Computer Use 智能体),支持 AMD64 与 ARM64,环境部署时间不到 10 秒。
推荐理由:ScreenEnv 把桌面智能体的运行环境收敛到 Docker 沙箱,并同时提供 MCP 与直连 API 两种接入方式,便于对照现有智能体框架的部署路径。