GPT-5 的"哥布林"输出从何而来
OpenAI 梳理了 GPT-5 中"哥布林"式输出的扩散时间线、根因与修复方案,将其归因于人格驱动的行为怪癖。
OpenAI 梳理了 GPT-5 中"哥布林"式输出的扩散时间线、根因与修复方案,将其归因于人格驱动的行为怪癖。
IBM Granite 团队发布技术文章,详解 Granite 4.1 系列(3B、8B、30B 稠密 decoder-only 模型)的构建流程:约 15T token 五阶段预训练、上下文扩展至 512K、约 4.1M 高质量样本的 SFT,以及基于 on-policy GRPO 与 DAPO loss 的多阶段强化学习。
推荐理由:Granite 团队公开了从数据配比到多阶段 RL 的完整训练细节,可对照其 8B 稠密模型追平 32B MoE 的取舍。
OpenAI 宣布扩展 Stargate,建设支撑 AGI 的算力基础设施,并新增数据中心容量以应对不断增长的 AI 需求。
OpenAI 提出一项五部分行动计划,旨在加强智能时代的网络安全,重点是普及 AI 驱动的网络防御并保护关键系统。
DeepInfra 成为 Hugging Face Hub 支持的 Inference Provider,首批上线对话与文本生成任务,可访问 DeepSeek V4、Kimi-K2.6、GLM-5.1 等开放权重 LLM。
NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解和 GUI 智能体操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等基准上取得领先成绩。
推荐理由:原文给出架构、训练配方与多模态基准对比,读者可据此判断开源全模态模型在文档、音视频与 GUI 智能体上的能力边界。
OpenAI 的 GPT 模型、Codex 和 Managed Agents 现已在 AWS 上可用,企业可在自己的 AWS 环境中构建安全的 AI 应用。
推荐理由:OpenAI 把 GPT 模型、Codex 与 Managed Agents 接入 AWS,读者可据此判断企业现有云环境能否直接落地。
OpenAI 发文说明其在 ChatGPT 中保障社区安全的方式,涵盖模型防护、滥用检测、政策执行以及与安全专家的合作。
OpenAI 宣布 ChatGPT Enterprise 和 OpenAI API 已获得 FedRAMP Moderate 授权,可供美国联邦机构安全采用 AI。该授权使联邦政府客户能够在合规框架下使用 OpenAI 的企业级产品与 API 服务。
Mistral AI 发布 Workflows 公开预览,定位为企业 AI 的编排层,提供持久化执行、可观测性和容错能力,用于把 AI 流程从概念验证推进到生产。
推荐理由:原文给出企业级 AI 编排层的持久化执行、可观测与人工审批能力,以及控制面与数据面分离的部署方式,可供评估生产落地路径。
Google DeepMind 宣布与韩国科学技术信息通信部(MSIT)建立合作,将在首尔办公室设立 AI Campus,向韩国学界开放 AlphaEvolve、AlphaGenome、AlphaFold、AI co-scientist 和 WeatherNext 等前沿模型。
OpenAI 与 Microsoft 宣布达成修订后的合作协议,简化双方合作关系并增加长期确定性,以支持持续的大规模 AI 创新。
推荐理由:OpenAI 与 Microsoft 修订合作协议,读者可据此了解双方长期合作框架的调整方向。
Choco 利用 OpenAI API 构建 AI 智能体,实现食品分销流程自动化,以提升生产力并推动业务增长。这是 OpenAI 发布的一则客户案例,聚焦 AI 在真实场景中的落地成效。
Hugging Face 博客介绍了基于 OpenAI 本周在 Hub 上开源的 Privacy Filter 构建三个 Web 应用的实践。Privacy Filter 是 1.5B 参数、50M 激活参数的 PII 检测模型,Apache 2.0 许可,单次前向处理 128k 上下文,覆盖八类 PII,在 PII-Masking-300k 基准上达到 SOTA。
推荐理由:原文给出三个基于 Privacy Filter 的完整应用示例,读者可参考其 gradio.Server 前后端分工方式来搭建自己的 PII 脱敏工具。
OpenAI 发布开源规范 Symphony,用于 Codex 编排,可把 issue tracker 变成常驻的智能体系统。该规范旨在提升工程产出并减少上下文切换。
OpenAI 发布由 Sam Altman 分享的五项原则,用于指导其确保 AGI 惠及全人类的工作。该内容以"我们的原则"为题,围绕 OpenAI 的使命展开。
OpenAI 发布一套新框架,分析 921 种职业和 1.48 亿个美国岗位,识别哪些角色面临自动化风险、重组、增长或受 AI 影响较小。
DeepSeek 发布 V4,两个 MoE 检查点上线 Hub:DeepSeek-V4-Pro 总参数 1.6T、激活 49B,DeepSeek-V4-Flash 总参数 284B、激活 13B,均支持 1M token 上下文窗口。
推荐理由:原文给出 V4 在长上下文推理成本与智能体后训练上的具体设计,可据此判断开源模型做长任务智能体的可行性。
OpenAI 发布 GPT-5.5,官方称其为面向编码、研究和数据分析等复杂任务打造的模型,可跨工具使用。目前公开信息仅为摘要,未披露参数、上下文窗口或评测数据。
推荐理由:OpenAI 官方发布 GPT-5.5,读者可据此了解新模型面向编码、研究与数据分析等复杂任务的定位。
OpenAI 分享 ChatGPT Work 的实用工作流,覆盖重复性任务、更新、研究、规划与团队运营等场景。内容面向日常办公,帮助用户把这些环节接入 ChatGPT Work 处理。
Hugging Face 发布教程,讲解如何在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI 功能,并以自家 Gemma 4 浏览器助手扩展为参考实现。
推荐理由:以官方发布的 Gemma 4 浏览器扩展为参照,拆解 MV3 下本地模型托管、消息契约与工具调用循环的架构取舍。
Google Photos 的 Auto frame 新增一项基于机器学习的重构图能力,把照片理解为 3D 场景并自动调整相机位置与焦距,生成原本未拍到的内容。该方法分两步:先用内部 3D 点图估计模型重建人体与面部并估算原焦距,再用生成式潜在扩散模型填补新视角下的空洞。该功能已上线,面向含人物的照片自动处理,重构图结果作为 Auto frame 候选中的第二个版本供用户选择。
推荐理由:Google Photos 把 3D 场景估计与生成式补全结合,读者可了解拍照后改变机位这一编辑思路的实现路径。
OpenAI 宣布 ChatGPT for Clinicians 面向通过验证的美国医生、执业护士和药剂师免费开放,用于支持临床诊疗、文书记录和研究工作。
推荐理由:OpenAI 面向美国临床人员免费开放 ChatGPT 临床版本,读者可据此了解医疗场景的准入范围与用途。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将训练拆分为解耦的计算孤岛并以异步数据流连接,降低带宽需求并隔离硬件故障。
推荐理由:原文给出分布式训练在带宽、容错和跨代硬件上的实测结果,可据此判断大规模预训练基础设施的演进方向。
OpenAI 详解 Codex 智能体循环如何借助 WebSockets 与连接级缓存降低 API 开销并改善模型延迟。
OpenAI 介绍如何在 ChatGPT 中构建和使用工作区智能体(workspace agents),用于自动化重复性工作流、连接工具并简化团队运营。
OpenAI 在 ChatGPT 中推出工作区智能体(workspace agents),由 Codex 驱动,可自动化复杂工作流并在云端运行。官方称其能帮助团队跨工具安全地扩展工作。
推荐理由:OpenAI 官方公布 ChatGPT 工作区智能体的定位与运行方式,可据此了解其自动化工作流的切入点。
OpenAI 发布 Privacy Filter,一款用于检测和脱敏文本中个人身份信息(PII)的开放权重模型,官方称其准确率达到 SOTA。目前公开信息仅为摘要,未披露模型规模、许可协议与开放入口。
推荐理由:OpenAI 开源一款用于检测和脱敏文本 PII 的开放权重模型,可了解其在隐私合规场景的定位。
Google Research 在 ICLR 论文中提出智能体记忆框架 ReasoningBank,从成功和失败经验中提炼高层推理模式,用于测试时自我进化。
推荐理由:Google Research 的 ICLR 论文提出从成功与失败经验中提炼推理记忆的框架,并给出 WebArena 与 SWE-Bench-Verified 上的对比数据。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,帮助企业规模化采用前沿 AI。合作方将获得包括 Gemini 系列在内的前沿模型早期访问权,并直接对接 Google DeepMind 技术团队,聚焦金融、制造、零售、媒体娱乐等行业的智能体转型。目前仅 25% 的组织成功将 AI 规模化投入生产。
OpenAI 发布 ChatGPT Images 2.0,改进了文字渲染、多语言支持和视觉推理能力。原文同时提到可查看 Images 2.5 的新变化。
推荐理由:官方给出图像生成能力的三项具体改进方向,可据此判断多语言与文字渲染场景的可用性变化。
Hugging Face 发布 QIMMA قِمّة 阿拉伯语 LLM 排行榜,在评测模型前先对基准做质量验证。该榜单整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖文化、STEM、法律、医疗、安全、诗歌文学与代码 7 大领域,其中 99% 为原生阿拉伯语内容,并首次在阿拉伯语排行榜中引入代码评测。
Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后 AI 网络安全格局,指出 Mythos 的关键不在模型本身,而在于其嵌入的系统——大算力、软件数据训练、漏洞探测与修补脚手架及一定自主性共同构成的能力配方。文章认为开放代码与工具可分散检测、验证、协调、补丁传播四个阶段,缩小攻防能力差距,并主张采用半自主 AI 智能体在组织内部署防御。
OpenAI 推出 Codex Labs,并与埃森哲、普华永道、Infosys 等合作,帮助企业在软件开发全生命周期中部署和扩展 Codex。OpenAI 同时公布 Codex 周活跃用户达到 400 万。
推荐理由:OpenAI 公布 Codex 周活 400 万并联合埃森哲、普华永道等推企业落地服务,可观察编码智能体的企业采用路径。
伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度避免高维视觉模型中的脆弱"状态-输入"梯度,使基于学习动力学(世界模型)的长时程规划变得可行。该工作与 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun 和 Amir Bar 合作完成。
凯悦(Hyatt)在全球员工队伍中部署 ChatGPT Enterprise,并使用 GPT-5.4 和 Codex 提升生产力、运营效率与宾客体验。OpenAI 为凯悦的 AI 落地提供支持。
Google Research 提出推理优先的合成数据生成框架 Simula,将数据集生成重构为机制设计问题,通过全局多样化、局部多样化、复杂化和双评审质量检查四个步骤,独立控制覆盖度、复杂度与质量。
Google Research 提出 MoGen(Neuronal Morphology Generation),用 PointInfinity 点云流匹配模型生成合成神经元形状,为 PATHFINDER 重建模型补充训练数据,使小鼠轴突重建误差降低 4.4%,主要来自合并错误的减少。
OpenAI 更新 macOS 和 Windows 版 Codex 应用,新增电脑操作、应用内浏览、图像生成、记忆和插件功能,用于加速开发者工作流。
推荐理由:原文列出 Codex 桌面端新增的电脑操作、应用内浏览、图像生成、记忆与插件,读者可据此判断开发工作流的变化。
OpenAI 发布 GPT-Rosalind,一款面向生命科学的前沿推理模型。该模型用于加速药物发现、基因组分析、蛋白质推理和科研工作流。
推荐理由:OpenAI 发布面向生命科学的前沿推理模型,读者可了解其在药物发现与基因组分析等科研流程中的定位。