OpenAI 发布 AgentKit、新版 Evals 与智能体 RFT
OpenAI 发布 AgentKit、扩展后的 Evals 能力以及面向智能体的强化微调(RFT),用于帮助开发者更快从原型走向生产。官方称这批工具覆盖智能体开发、评估与微调环节。
推荐理由:OpenAI 官方发布面向智能体开发的工具组合,读者可据此了解其从原型到生产的工具链布局。
技术方向
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
239 条精选近 30 天 23 条共收录 717 条
OpenAI 发布 AgentKit、扩展后的 Evals 能力以及面向智能体的强化微调(RFT),用于帮助开发者更快从原型走向生产。官方称这批工具覆盖智能体开发、评估与微调环节。
推荐理由:OpenAI 官方发布面向智能体开发的工具组合,读者可据此了解其从原型到生产的工具链布局。
OpenAI、Oracle 和 SoftBank 宣布为 Stargate 新增五个 AI 数据中心站点,推进一项 5000 亿美元、10 吉瓦的美国基础设施扩建计划。该计划旨在支撑下一代 AI,并创造数万个就业岗位。
推荐理由:Stargate 新增五个站点,读者可了解 5000 亿美元、10 吉瓦级 AI 数据中心建设的推进节奏。
OpenAI 与 NVIDIA 宣布战略合作,将部署 10 吉瓦由 NVIDIA 系统驱动的 AI 数据中心,首期于 2026 年启动。
推荐理由:OpenAI 与 NVIDIA 的 10 吉瓦算力合作给出了规模与首期时间点,可据此观察前沿模型训练算力的供给节奏。
Hugging Face 发布博客,介绍为支持 OpenAI gpt-oss 系列而在 transformers 中做的多项升级,包括可从 Hub 下载的零构建 Kernel、MXFP4 量化、张量并行、专家并行、动态滑动窗口层与缓存、连续批处理与 Paged Attention,以及更快的模型加载。
推荐理由:Hugging Face 官方拆解了为 gpt-oss 引入 transformers 的七项工程改动,可据此了解量化、并行与缓存优化的落地方式。
Mistral 在 Le Chat 中发布 20+ 个基于 MCP 的安全连接器目录(beta),覆盖数据、生产力、开发、自动化与商务等类别,支持接入 Databricks、Snowflake、GitHub、Atlassian、Asana、Outlook、Box、Stripe、Zapier 等工具,并可添加自定义 MCP 连接器或连接任意远程 MCP 服务器。
推荐理由:官方给出连接器目录与记忆功能的开放范围,读者可据此判断企业工作流接入的可行路径。
Hugging Face 的 TRL 新增面向视觉语言模型的对齐能力,包括混合偏好优化 MPO、多模态 GRPO 以及 Qwen 提出的 GSPO,并扩展 RLOO 与 Online DPO 支持 VLM。
推荐理由:TRL 把 MPO、GRPO、GSPO 等对齐方法扩展到视觉语言模型,并给出可直接运行的训练脚本与 notebook。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开源权重语言模型,采用 Apache 2.0 许可。官方称这两款模型在推理任务上优于同规模开源模型,具备较强的工具调用能力,并针对消费级硬件的高效部署做了优化。
推荐理由:OpenAI 开源两款权重模型并给出尺寸与许可,读者可据此判断消费级硬件上的部署与推理选择。
Mistral AI 发布 Codestral 25.08 代码模型,并推出覆盖补全、语义检索与智能体工作流的企业级编码栈。Codestral 25.08 相比前代补全接受率提升 30%、建议后保留代码增加 10%、失控生成减少 50%,支持云、VPC 与本地部署。
推荐理由:Mistral 官方给出编码栈各组件的能力数字与私有化部署路径,可据此判断企业自建编码助手的可行边界。
Hugging Face 发布针对 Flux.1-Dev 的 LoRA 推理优化配方,结合 Flash Attention 3、torch.compile 与 FP8 量化,在 H100 上相比基线实现 2.23 倍加速。
推荐理由:原文给出可复用的 LoRA 推理优化配方与实测延迟数据,读者可据此判断热切换与量化在自有硬件上的取舍。
NVIDIA 宣布通过 NIM 推理微服务在 Hugging Face 上解锁超过 10 万个 LLM 的快速可靠部署。NIM 现在提供单个 Docker 容器,可部署由 TensorRT-LLM、vLLM 和 SGLang 支持的多种 LLM,并自动完成模型格式识别、架构与量化格式检测、后端选择和性能配置,无需手动调优。
推荐理由:NIM 用单个容器自动识别模型格式与量化方式并选择推理后端,读者可据此判断多模型部署流程能简化到什么程度。
Hugging Face 宣布 Hub 存储从 Git LFS 迁移到 Xet,6 个月内已有 50 万个仓库、20 PB 数据完成迁移,超过 100 万用户在使用 Xet。迁移依靠 Git LFS Bridge 和后台迁移流程实现,旧版客户端无需更换工作流即可继续上传下载。从本月起 Xet 将向所有用户开放,现有仓库会自动迁移,新建仓库默认启用 Xet,后续还将开源 Xet 协议及整套基础设施。
推荐理由:Hugging Face 官方复盘 Hub 从 Git LFS 迁移到 Xet 的工程细节,可看到大规模存储迁移如何做到对用户零打扰。
Hugging Face 发布 ScreenEnv,一个可在 Docker 容器中创建隔离 Ubuntu 桌面环境的 Python 库,用于测试和部署 GUI 智能体(Computer Use 智能体),支持 AMD64 与 ARM64,环境部署时间不到 10 秒。
推荐理由:ScreenEnv 把桌面智能体的运行环境收敛到 Docker 沙箱,并同时提供 MCP 与直连 API 两种接入方式,便于对照现有智能体框架的部署路径。
Hugging Face 发布教程,介绍用 diffusers 库和 QLoRA 在单张 GPU 上微调 FLUX.1-dev,峰值显存约 10GB 以下。在 RTX 4090 上,QLoRA 峰值显存约 9GB,标准 BF16 LoRA 需 26GB,700 步训练约 41 分钟。
推荐理由:原文给出在单张消费级 GPU 上微调 FLUX.1-dev 的完整配置与显存对比,可据此复现低显存训练流程。
Mistral AI 发布 Mistral Compute,提供从裸金属服务器到全托管 PaaS 的私有集成 AI 基础设施栈,涵盖 GPU、编排、API、产品与服务。
推荐理由:Mistral 把自建训练与推理基础设施对外产品化,读者可据此判断欧洲主权 AI 算力供给的另一种路径。
Hugging Face 与 NVIDIA 在 GTC Paris 宣布合作推出 Training Cluster as a Service,让全球研究机构更便捷地获取大型 GPU 集群,按训练运行时长付费。
推荐理由:原文给出按训练时长付费的 GPU 集群申请入口和 NVIDIA DGX Cloud Lepton 的接入方式,读者可据此判断算力获取路径的变化。
Mistral 发布企业级 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,支持云端、专属容量与气隙本地 GPU 部署,代码留在企业边界内。
推荐理由:官方给出企业级编码助手的模型组合、部署形态与首批客户,可据此判断私有化编码方案的落地路径。
Mistral AI 发布首个面向代码的嵌入模型 Codestral Embed,官方称其在真实代码数据检索任务上优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
推荐理由:官方给出代码嵌入模型在检索基准上的对比与按维度裁剪的存储成本权衡,可据此评估代码 RAG 的选型。
Mistral 发布 Agents API,将自家语言模型与代码执行、图像生成、文档库、Web 搜索等内置连接器以及 MCP 工具结合,并提供跨对话的持久记忆与智能体编排能力。
推荐理由:官方给出 Agents API 的连接器、记忆与多智能体编排能力,可据此判断企业级智能体平台的搭建方式。
OpenAI 宣布推出 Stargate UAE,这是其 AI 基础设施平台 Stargate 的首次国际部署。
推荐理由:OpenAI 官方宣布 Stargate 首次落地海外,读者可据此了解其 AI 基础设施的国际化布局。
Hugging Face 在博客中表示,未来目标是让 Transformers 成为各框架之间的模型定义中枢,模型架构只要被 Transformers 支持,就能在生态其他工具中获得支持。
推荐理由:Hugging Face 官方说明 Transformers 将作为跨框架模型定义中枢,读者可据此理解模型接入与部署链路的变化。