OpenAI 在 API 平台推出 GPT-5
OpenAI 在 API 平台推出 GPT-5,主打高推理性能、面向开发者的新控制项,以及在真实编码任务上的领先结果。
推荐理由:OpenAI 在 API 平台上线 GPT-5,开发者可据此了解新模型在推理与真实编码任务上的定位。
OpenAI 在 API 平台推出 GPT-5,主打高推理性能、面向开发者的新控制项,以及在真实编码任务上的领先结果。
推荐理由:OpenAI 在 API 平台上线 GPT-5,开发者可据此了解新模型在推理与真实编码任务上的定位。
OpenAI 发布文章介绍 GPT-5 在编码与设计上的新可能,但 feed 仅提供摘要,未给出具体功能、示例或数据。
OpenAI 发布文章介绍 GPT-5 在创意写作中的应用。
OpenAI 发文介绍 GPT-5 在医学研究中的用途。原文未披露具体功能、参数或评测数据,仅说明可了解 GPT-5 如何被用于医学研究。
OpenAI 发文介绍生物医药公司 Amgen 如何使用 GPT-5。原文未披露具体应用场景、使用规模或效果数据。
OpenAI 发布 GPT-5 系统卡,说明其通过统一模型路由系统在 gpt-5-main、gpt-5-thinking 以及 gpt-5-thinking-nano 等轻量版本之间分配任务,以针对不同任务和开发者用途提供快速或更强的响应。
推荐理由:系统卡披露 GPT-5 用统一路由在多个模型间分配任务,可据此了解其快慢响应的实现方式。
OpenAI 发文介绍 Cursor 如何使用 GPT-5。原文未披露具体功能细节、参数或性能数据。
OpenAI 发布 GPT-5,并展示一组领先开发者首次使用该模型的过程。官方页面以开发者首次上手的形式呈现 GPT-5 的使用情况,未披露具体能力参数与开放时间。
OpenAI 发布 GPT-5,称其为迄今最强的 AI 系统,在智能水平上较此前所有模型有显著跃升。官方称 GPT-5 在编码、数学、写作、健康、视觉感知等方面达到 SOTA 表现。
推荐理由:OpenAI 官方发布 GPT-5,给出其在编码、数学、写作、健康与视觉感知上的能力定位。
Hugging Face 的 TRL 新增面向视觉语言模型的对齐能力,包括混合偏好优化 MPO、多模态 GRPO 以及 Qwen 提出的 GSPO,并扩展 RLOO 与 Online DPO 支持 VLM。
推荐理由:TRL 把 MPO、GRPO、GSPO 等对齐方法扩展到视觉语言模型,并给出可直接运行的训练脚本与 notebook。
OpenAI 在 GPT-5 中引入 safe-completions 方法,用更细致的输出级安全训练取代此前的硬拒绝策略,以同时提升安全性与有用性。该方案针对双用途提示词,从以输出为中心的角度处理响应,而非直接拒绝作答。
OpenAI for Government 宣布与美国总务管理局(GSA)达成合作,未来一年内 ChatGPT Enterprise 将以近乎零成本提供给整个联邦行政部门的工作人员使用。
推荐理由:OpenAI 与美国 GSA 达成合作,读者可了解 ChatGPT Enterprise 在美国联邦政府部门的落地范围与期限。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开源权重语言模型,采用 Apache 2.0 许可。官方称这两款模型在推理任务上优于同规模开源模型,具备较强的工具调用能力,并针对消费级硬件的高效部署做了优化。
推荐理由:OpenAI 开源两款权重模型并给出尺寸与许可,读者可据此判断消费级硬件上的部署与推理选择。
OpenAI 发布其能力最强的开放权重模型,称这是让先进 AI 更开放、灵活和可及的重要一步。官方表示,此次发布旨在推动 AI 惠及尽可能多的人,但未在摘要中给出具体模型名称、参数或能力细节。
推荐理由:OpenAI 官方宣布发布其能力最强的开放权重模型,读者可据此了解其开放与可及性主张。
OpenAI 发布开源权重模型家族 gpt-oss,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,两者均为 MoE 架构并采用 MXFP4 4-bit 量化,激活参数分别为 5.1B 和 3.6B,采用 Apache 2.0 许可。
推荐理由:Hugging Face 汇总了 gpt-oss 两个开源模型的参数、量化方案与各推理框架的适配情况,可据此判断本地部署门槛。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重推理模型,采用 Apache 2.0 许可,并适用 gpt-oss 使用政策。
推荐理由:OpenAI 以 Apache 2.0 开源两款推理模型,读者可据此了解开放权重模型的新选项与许可条件。
OpenAI 研究发布开放权重模型 gpt-oss 的最坏情况前沿风险,提出"恶意微调"(MFT)方法,通过微调让 gpt-oss 在生物学和网络安全两个领域尽可能发挥最大能力。
NVIDIA 的 AI-Q Blueprint 在 DeepResearch Bench 的 Hugging Face "LLM with Search" 榜单上以 40.52 分登顶,成为得分最高的全开源许可方案。
OpenAI 正在优化 ChatGPT 对用户困境时刻的支持,已上线休息提醒功能,并着手改进生活建议,整个过程参考专家意见。这些调整旨在让 ChatGPT 更好地帮助用户以自己期望的方式生活。
Hugging Face 推出 3LM(علم),一个评估阿拉伯语 LLM 在 STEM 与代码生成任务上表现的多组件基准,包含 865 道原生 STEM 选择题、1744 道合成高难度选择题,以及翻译自 HumanEval+ 和 MBPP+ 的阿拉伯语代码基准。
Mistral 用 LoRA 微调 Pixtral-12B,在 Aerial Image Dataset(AID)卫星图像分类任务上显著优于基座模型。基座模型在 Playground、Stadium 等易混类别上会误判并偶发幻觉出不存在的类别名,微调后分类更准确。整个流程可通过 Mistral 微调 API 或 LaPlateforme UI 完成,无需大量超参数调优。
Figma 正用 AI 变革数字设计,David Kossnick 分享了 Figma Make 等工具如何让团队借助 AI 进行原型设计、协作与构建。这些工具正在重塑设计师、开发者以及非技术创作者的工作流程。
Hugging Face 博客演示了如何用 Gradio 的 MCP 集成在 Python 中搭建 AI 购物助手,将 Python 函数自动转换为 LLM 可调用的 MCP 工具。该助手结合 IDM-VTON 扩散模型实现虚拟试衣,并通过 VS Code AI Chat 调用 vton 与 playwright 两个 MCP 服务器,完成浏览服装网站并生成试穿效果图。
OpenAI 在 OpenAI for Countries 计划下启动 Stargate Norway,这是其在欧洲的首个 AI 数据中心计划。Stargate 是 OpenAI 的整体基础设施平台,也是其长期愿景的关键部分。
Mistral AI 发布 Codestral 25.08 代码模型,并推出覆盖补全、语义检索与智能体工作流的企业级编码栈。Codestral 25.08 相比前代补全接受率提升 30%、建议后保留代码增加 10%、失控生成减少 50%,支持云、VPC 与本地部署。
推荐理由:Mistral 官方给出编码栈各组件的能力数字与私有化部署路径,可据此判断企业自建编码助手的可行边界。
Intercom 分享了构建可扩展 AI 平台的三条经验,涵盖评估体系与架构设计,目标是引领客户支持的未来。内容围绕如何将 AI 能力沉淀为可持续的竞争优势展开。
OpenAI 在 ChatGPT 中推出学习模式(study mode),这是一种新的学习体验,帮助用户一步步解决问题。该模式通过提问、脚手架和反馈引导学生,以支持更深入的学习。
Hugging Face 发布开源免费的实验追踪 Python 库 Trackio,提供本地 Gradio 仪表盘并支持同步到 Hugging Face Spaces 分享。
推荐理由:Hugging Face 官方开源实验追踪库,兼容 wandb API 且可同步到 Spaces 分享,读者可据此判断迁移成本。
Hugging Face 官方 CLI 从 huggingface-cli 正式更名为 hf,命令按资源分组为 hf auth、hf cache、hf repo 等,并保留 hf upload、hf download 在根层级。
PyArrow 和 Pandas 现已支持 Parquet 内容定义分块(CDC),可在 Hugging Face 的 Xet 存储层上对 Parquet 文件高效去重,只上传或下载发生变化的 chunk。
Outtake 利用 GPT-4.1 和 OpenAI o3 驱动 AI 智能体,检测和处置数字威胁的速度比以往快 100 倍。
Hugging Face 开源长视频理解基准 TimeScope,通过在 1 分钟至 8 小时的视频中插入 5-10 秒的"needle"片段,评测模型的局部检索、信息综合与细粒度时序感知三项能力。结果显示,包括 Gemini 2.5-Pro 在内的领先视觉语言模型在真正的长视频时序理解上仍表现吃力,性能随视频变长明显下滑。
Hugging Face 发布针对 Flux.1-Dev 的 LoRA 推理优化配方,结合 Flash Attention 3、torch.compile 与 FP8 量化,在 H100 上相比基线实现 2.23 倍加速。
推荐理由:原文给出可复用的 LoRA 推理优化配方与实测延迟数据,读者可据此判断热切换与量化在自有硬件上的取舍。
OpenAI 将于 2025 年 10 月 6 日在旧金山 Fort Mason 举办第三届年度 OpenAI DevDay。
Model ML CEO Chaz Englander 在 OpenAI Executive Function 系列访谈中表示,AI 原生基础设施与自主智能体正在重构金融服务的工作流。
Mistral AI 联合 Carbone 4 和法国生态转型署(ADEME)完成首个 AI 模型全生命周期分析,并公开 Mistral Large 2 的环境足迹:截至 2025 年 1 月,训练加 18 个月使用共产生 20.4 ktCO₂e、消耗 281 000 m³ 水和 660 kg Sb eq。
OpenAI 与 Penda Health 联合推出 AI 临床副驾驶,在实际使用中将诊断错误率降低 16%。该工具为医疗领域安全、有效地应用 AI 提供了一条新路径。
OpenAI 与 Oracle 达成协议,将在美国为 Stargate 新增 4.5 GW 数据中心容量。OpenAI 称该投资将创造就业、加速美国再工业化,并推进其在美 AI 领先地位,这也是 Stargate 这一 AI 基础设施平台的重要节点。
推荐理由:OpenAI 与 Oracle 就 Stargate 新增 4.5 GW 数据中心容量达成协议,可据此观察其美国算力布局的推进节奏。
OpenAI 发布新经济分析,揭示 ChatGPT 对经济的影响,并同步启动一项新的研究合作,以研究 AI 对劳动力市场和生产力更广泛的影响。
NVIDIA 宣布通过 NIM 推理微服务在 Hugging Face 上解锁超过 10 万个 LLM 的快速可靠部署。NIM 现在提供单个 Docker 容器,可部署由 TensorRT-LLM、vLLM 和 SGLang 支持的多种 LLM,并自动完成模型格式识别、架构与量化格式检测、后端选择和性能配置,无需手动调优。
推荐理由:NIM 用单个容器自动识别模型格式与量化方式并选择推理后端,读者可据此判断多模型部署流程能简化到什么程度。