跳到正文
7月7日周二
  1. Hugging Face Blog76

    LeRobot v0.6.0 发布:世界模型策略、奖励模型与部署 CLI

    Hugging Face 发布 LeRobot v0.6.0,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新一批 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT)以及统一奖励模型 API(Robometer、TOPReward)。

    推荐理由:LeRobot v0.6.0 把世界模型策略、奖励模型与部署 CLI 串成闭环,读者可据此了解开源机器人学习栈的当前形态。

  2. Hugging Face Blog62

    SkyPilot 与 Hugging Face 打通零出口费存储,可在任意云运行 AI 负载

    SkyPilot 与 Hugging Face 联合推出 store: hf 存储后端,用一条 hf:// URL 和现有 HF_TOKEN 即可把 Hugging Face Bucket 或任意模型、数据集仓库挂载进 SkyPilot 任务,并在 20 多个云、Kubernetes、Slurm 和本地环境中调度运行。

    推荐理由:原文给出零出口费存储与跨云调度的组合方式,读者可据此判断数据与 GPU 分离时的成本结构。

7月6日周一
  1. Hugging Face Blog34

    PRX Part 4:我们的数据策略

    PRX 系列第 4 篇披露其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,再转为可流式训练的语料。团队用 Lance 做数据构建与筛选、MDS 做流式训练,并将文本编码器从 T5Gemma 换成 Qwen3-VL,改为训练中实时计算文本 latent,实测吞吐损失约 3–4%(30 天训练多约 1 天)。图像统一以 JPEG quality 92 编码。

  2. Hugging Face Blog34

    Hugging Face Kernels 项目重大更新:新增 kernel 仓库类型与代码签名

    Hugging Face 为 Kernels 项目引入 Hub 上的全新 "kernel" 仓库类型,并新增可信发布者与代码签名两层安全机制,默认只加载可信发布者的 kernel。项目还重构了 kernels 与 kernel-builder 的 CLI,新增对 Torch Stable ABI 和 Apache TVM FFI 的支持,为智能体自主开发 kernel 打下基础。

7月3日周五
  1. Google DeepMind38

    Google DeepMind 与 A24 宣布首个此类研究合作

    Google DeepMind 与 A24 宣布达成首个此类研究合作,将顶尖研究实验室与电影制作公司配对,帮助艺术家开发新工作流与技术。合作将跨越多个项目,让 A24 及其电影人直接参与塑造新技术,同时为 Google DeepMind 提供艺术家反馈。Google 还对 A24 进行了投资。

7月2日周四
  1. Mistral AI71

    Mistral 发布 Leanstral 1.5 形式化验证模型

    Mistral 发布 Leanstral 1.5,采用 Apache-2.0 许可,119B 总参数、6B 激活参数,在形式化验证上大幅升级:miniF2F 达到 100%,PutnamBench 解出 587/672 题,FATE-H 87%、FATE-X 34% 均为新 SOTA。

    推荐理由:官方给出 Leanstral 1.5 在形式化验证基准上的成绩与成本对比,可据此判断开源证明模型的实用边界。

7月1日周三
  1. Berkeley AI Research17

    2026 届 BAIR 博士毕业生展示:从机器人到 LLM 推理的研究全景

    伯克利人工智能研究实验室(BAIR)公布 2026 届博士毕业生名单,其研究覆盖机器人、具身智能、大语言模型与推理、计算机视觉、生成建模、AI 安全、人机交互及 AI for Science 等方向。毕业生去向包括 OpenAI、Mistral AI、Physical Intelligence、Amazon 等机构,以及 UCLA、普林斯顿 CITP 和芝加哥大学等学术岗位,部分人仍在探索下一步。

  2. Hugging Face Blog62

    Hugging Face 与 Cerebras 将 Gemma 4 引入实时语音 AI

    Hugging Face 与 Cerebras 联合演示了一套实时语音到语音的开源流水线,用 Cerebras 加速 Gemma 4 31B 的推理。该架构为模块化设计,依次经过 Nvidia Parakeet 语音识别、Cerebras 上的 Gemma 4 VLM 推理和阿里 Qwen3TTS 语音合成,各层均可替换。

    推荐理由:原文给出了一套可替换的实时语音到语音开源架构,读者可据此了解各层组件如何组合与复用。

6月30日周二
  1. Google Research76

    Google 发布 TabFM 零样本表格数据基础模型

    Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。

    推荐理由:原文给出零样本表格预测的架构设计与 TabArena 基准对比,可据此判断它能否替代传统树模型流程。

  2. Hugging Face Blog60

    Hugging Face 模型页展示 Every Eval Ever 评测结果

    Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,评测结果可交叉发布并链接回完整记录。EEE 数据存储已收录约 229,000 条评测结果,覆盖 22,000 多个模型和 2,200 个基准,来自 31 种报告格式。

    推荐理由:原文给出 EEE 与 Community Evals 互通后的数据规模与转换工具,读者可据此判断评测结果如何被统一记录和追溯。

6月29日周一
6月27日周六
  1. Google Research62

    Google 用冻结多 token 预测加速 Pixel 上的 Gemini Nano 模型

    Google Research 发布新架构,将多 token 预测(MTP)头接到已冻结的 Gemini Nano v3 模型上,在不改动主干权重的前提下加速端侧推理,已上线 Pixel 9 和 10 系列。

    推荐理由:Google 把多 token 预测接到冻结的 Gemini Nano v3 上,读者可了解端侧推理在内存与能耗约束下的具体优化路径。

6月26日周五
  1. OpenAI News62

    OpenAI 预告下一代模型 GPT-5.6 Sol

    OpenAI 预告下一代模型 GPT-5.6 Sol,称其在编码、科学和网络安全方面具备更强能力,并搭配其最先进的安全技术栈。

    推荐理由:OpenAI 官方预告下一代模型 GPT-5.6 Sol,读者可据此了解其在编码、科学与网络安全上的能力方向。

6月25日周四
  1. Hugging Face Blog60

    NVIDIA NeMo AutoModel 发布,MoE 微调吞吐提升 3.4-3.7 倍

    NVIDIA 发布开源库 NeMo AutoModel,在 HuggingFace Transformers v5 之上加入 Expert Parallelism、DeepEP 融合 all-to-all 调度和 TransformerEngine 内核,微调 MoE 模型时训练吞吐提升 3.4-3.7 倍、GPU 显存减少 29-32%。

    推荐理由:原文给出同一 from_pretrained() API 下的吞吐与显存对比数据,读者可据此判断 MoE 微调的迁移成本。

6月24日周三
6月23日周二
  1. Mistral AI67

    Mistral 发布 OCR 4 文档解析模型

    Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言、10 个语系,可单容器自托管部署。

    推荐理由:官方给出 OCR 4 的边界框、块分类与置信度输出,以及自托管和按页计价方案,便于评估文档解析管线。

6月22日周一