跳到正文
11月13日周四
  1. OpenAI News78

    OpenAI 面向开发者发布 GPT-5.1

    GPT-5.1 已在 API 中开放,带来更快的自适应推理、扩展的提示词缓存和改进的编码表现。同时新增 apply_patch 和 shell 两个工具。

    推荐理由:GPT-5.1 进入 API,开发者可据此判断自适应推理、缓存与编码能力的升级幅度。

11月12日周三
  1. Google Research49

    Google 发布 JAX-Privacy 1.0:面向大规模机器学习的差分隐私工具库

    Google 发布 JAX-Privacy 1.0,这是构建在 JAX 之上、用于训练和审计差分隐私(DP)模型的工具库,重新设计以提升模块化。它提供逐样本梯度裁剪、噪声添加、数据批构建等核心组件,支持 DP-SGD、DP-FTRL 及 DP matrix factorization 等算法,并借助 JAX 的 vmap、shard_map 实现数据与模型并行的大规模训练。

11月11日周二
  1. Google DeepMind57

    Google DeepMind 在 Nature 发表研究,让 AI 视觉表征更接近人类

    Google DeepMind 在 Nature 发表新论文,分析 AI 视觉模型与人类在视觉表征组织上的差异,并提出一种三步对齐方法。该方法先用 THINGS 数据集训练一个冻结主模型的小适配器作为教师模型,再生成包含百万张图像、数百万条类人判断的 AligNet 数据集,最后微调其他学生模型。

11月10日周一
11月8日周六
11月7日周五
11月6日周四
11月5日周三
  1. Google Research40

    Google 发布 ForestCast:用深度学习预测森林砍伐风险并开源基准数据集

    Google 发布 ForestCast,用纯卫星数据与视觉 Transformer 预测森林砍伐风险,并公开首个面向该任务的深度学习基准数据集。模型仅输入 Landsat、Sentinel 2 及“变化历史”数据,精度可匹敌或超过依赖道路等专用地图的传统方法,其中变化历史是最关键输入。相关训练与评估数据已开放,供社区复现并构建更优模型。

  2. Google Research62

    Google 发布 Project Suncatcher 太空 AI 基础设施系统设计预印本

    Google 公布名为 Project Suncatcher 的研究计划,设想由太阳能卫星组成星座、搭载 Google TPU 并通过自由空间光链路互联,相关预印本论文探讨了卫星间高带宽通信、轨道动力学和辐射对计算的影响。

    推荐理由:Google 公开了太空 AI 数据中心的系统设计与关键挑战,读者可了解其轨道方案、星间链路和 TPU 抗辐射测试的早期结论。

11月4日周二
11月3日周一
  1. OpenAI News72

    OpenAI 与 AWS 达成 380 亿美元多年战略合作

    OpenAI 与 AWS 宣布达成多年期、金额 380 亿美元的战略合作,AWS 将提供基础设施与算力,用于支撑 OpenAI 下一代模型。合作由双方官方发布,具体落地节奏与算力规模未在摘要中披露。

    推荐理由:OpenAI 与 AWS 达成 380 亿美元多年合作,读者可据此了解其算力供应格局的新变化。

11月1日周六
  1. Berkeley AI Research34

    无需 TD 学习的强化学习:分治法如何扩展到长时程任务

    一篇新文章提出用"分治"范式替代时序差分(TD)学习来做 off-policy 强化学习,通过将轨迹对半切分并组合子段价值来更新整体价值,理论上把 Bellman 递归次数从线性降到对数级。作者与 Aditya 合作的工作首次将分治价值学习扩展到目标条件强化学习这类复杂任务,且无需像 n-step TD 那样调节超参数 n。目前该方法仍面临如何选取最优子目标 w 的难题。

10月31日周五
10月30日周四
  1. OpenAI News60

    OpenAI 推出智能体安全研究员 Aardvark

    OpenAI 推出 Aardvark,一款 AI 驱动的安全研究员,可自主发现、验证并协助修复软件漏洞,并支持规模化处理。该系统目前处于私有测试阶段,可通过报名参与早期测试。

    推荐理由:OpenAI 官方披露智能体安全研究员 Aardvark 的定位与私有测试入口,可据此了解其自主发现并修复漏洞的能力方向。

  2. Hugging Face Blog42

    MiniMax M2 的智能体对齐:从基准测试到真实世界泛化

    MiniMax M2 的后训练团队分享了智能体对齐的核心经验:智能体需要交错思考(Interleaved Thinking),在任务全程而非仅在开头进行推理,以应对工具输出带来的持续扰动。团队发现,仅靠工具数量扩展无法实现泛化,真正的泛化要求模型对整个操作空间中的扰动保持稳定,包括系统提示词、用户提示词、环境和工具响应。M2 用户需保留包含思考步骤的完整会话历史,因为上下文就是它的记忆。

10月29日周三
  1. Hugging Face Blog66

    Hugging Face 分析全球算力格局变化:中国开源模型与国产芯片的相互牵引

    Hugging Face 发布分析文章,指出中国开源权重模型的推理已开始由华为昇腾、寒武纪等国产芯片承载,部分模型开始用国产芯片训练。文章认为美国出口管制与中国芯片产能提速高度相关,算力稀缺也促使 DeepSeek 的 MLA、GRPO 等效率创新走向开源,并推动 CUDA 之外的软件生态成形。

    推荐理由:梳理中国开源模型与国产芯片互相牵引的路径,可看到算力受限如何反过来塑造模型架构与部署生态。

  2. Hugging Face Blog62

    NVIDIA Isaac for Healthcare 如何从仿真到部署构建医疗机器人

    NVIDIA 发布 Isaac for Healthcare v0.4,提供基于 SO-ARM 的端到端手术辅助机器人工作流,覆盖数据采集、训练与真机部署。该工作流用 LeRobot 采集仿真与真机数据,后训练 GR00T N1.5,并在 Isaac Lab 评估后部署到硬件,其中超过 93% 的训练数据由仿真合成生成。

    推荐理由:原文给出从仿真采集、GR00T N1.5 后训练到真机部署的完整命令与硬件要求,可据此复现医疗机器人工作流。

10月28日周二