跳到正文
7月27日周一
  1. Hugging Face Blog66

    NVIDIA 发布 Cosmos-H-Dreams 实时手术机器人生成式仿真器

    NVIDIA 发布 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 流式推理库提供服务。

    推荐理由:原文给出实时生成式手术仿真器的蒸馏与推理优化路径,读者可据此判断世界模型进入交互闭环的工程门槛。

7月23日周四
  1. Hugging Face Blog62

    Diffusers 原生支持 Nunchaku 4-bit 扩散推理

    Hugging Face 在 Diffusers 中集成 Nunchaku Lite,可直接用 from_pretrained() 加载 Nunchaku 风格 4-bit 量化检查点,无需自定义 pipeline 或本地 CUDA 编译。

    推荐理由:原文给出 Nunchaku Lite 在 Diffusers 中的原生加载方式与量化工具链,读者可据此判断消费级 GPU 跑扩散模型的内存与延迟取舍。

7月21日周二
  1. Hugging Face Blog62

    Hugging Face 发布 Grabette 开源机器人操作数据采集系统

    Hugging Face 发布 Grabette,一套开源低成本的手持夹爪数据采集系统,用户无需机器人即可用手持设备录制操作演示,并自动转换为 LeRobot 格式数据集。

    推荐理由:原文给出了一套无需机器人即可采集操作数据的开源方案,读者可据此判断数据采集门槛与开源生态的衔接方式。

7月16日周四
7月15日周三
  1. Hugging Face Blog87

    Thinking Machines 发布 Inkling 与 Inkling-Small 开源多模态模型

    Thinking Machines 在 Hugging Face 发布 Inkling 系列开源多模态模型,Inkling 为 975B 总参数、41B 激活参数的 MoE 架构,原生接受图像、文本和音频输入,支持 1M 上下文,训练数据达 45 万亿 token。

    推荐理由:原文给出 Inkling 的架构细节、部署配置与基准对比,读者可据此判断这一开源多模态模型的落地门槛。

7月8日周三
7月7日周二
  1. Hugging Face Blog76

    LeRobot v0.6.0 发布:世界模型策略、奖励模型与部署 CLI

    Hugging Face 发布 LeRobot v0.6.0,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新一批 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT)以及统一奖励模型 API(Robometer、TOPReward)。

    推荐理由:LeRobot v0.6.0 把世界模型策略、奖励模型与部署 CLI 串成闭环,读者可据此了解开源机器人学习栈的当前形态。

  2. Hugging Face Blog62

    SkyPilot 与 Hugging Face 打通零出口费存储,可在任意云运行 AI 负载

    SkyPilot 与 Hugging Face 联合推出 store: hf 存储后端,用一条 hf:// URL 和现有 HF_TOKEN 即可把 Hugging Face Bucket 或任意模型、数据集仓库挂载进 SkyPilot 任务,并在 20 多个云、Kubernetes、Slurm 和本地环境中调度运行。

    推荐理由:原文给出零出口费存储与跨云调度的组合方式,读者可据此判断数据与 GPU 分离时的成本结构。

7月6日周一
  1. Hugging Face Blog34

    PRX Part 4:我们的数据策略

    PRX 系列第 4 篇披露其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,再转为可流式训练的语料。团队用 Lance 做数据构建与筛选、MDS 做流式训练,并将文本编码器从 T5Gemma 换成 Qwen3-VL,改为训练中实时计算文本 latent,实测吞吐损失约 3–4%(30 天训练多约 1 天)。图像统一以 JPEG quality 92 编码。

  2. Hugging Face Blog34

    Hugging Face Kernels 项目重大更新:新增 kernel 仓库类型与代码签名

    Hugging Face 为 Kernels 项目引入 Hub 上的全新 "kernel" 仓库类型,并新增可信发布者与代码签名两层安全机制,默认只加载可信发布者的 kernel。项目还重构了 kernels 与 kernel-builder 的 CLI,新增对 Torch Stable ABI 和 Apache TVM FFI 的支持,为智能体自主开发 kernel 打下基础。

7月2日周四
  1. Mistral AI71

    Mistral 发布 Leanstral 1.5 形式化验证模型

    Mistral 发布 Leanstral 1.5,采用 Apache-2.0 许可,119B 总参数、6B 激活参数,在形式化验证上大幅升级:miniF2F 达到 100%,PutnamBench 解出 587/672 题,FATE-H 87%、FATE-X 34% 均为新 SOTA。

    推荐理由:官方给出 Leanstral 1.5 在形式化验证基准上的成绩与成本对比,可据此判断开源证明模型的实用边界。

7月1日周三
  1. Hugging Face Blog62

    Hugging Face 与 Cerebras 将 Gemma 4 引入实时语音 AI

    Hugging Face 与 Cerebras 联合演示了一套实时语音到语音的开源流水线,用 Cerebras 加速 Gemma 4 31B 的推理。该架构为模块化设计,依次经过 Nvidia Parakeet 语音识别、Cerebras 上的 Gemma 4 VLM 推理和阿里 Qwen3TTS 语音合成,各层均可替换。

    推荐理由:原文给出了一套可替换的实时语音到语音开源架构,读者可据此了解各层组件如何组合与复用。

6月30日周二
  1. Google Research76

    Google 发布 TabFM 零样本表格数据基础模型

    Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。

    推荐理由:原文给出零样本表格预测的架构设计与 TabArena 基准对比,可据此判断它能否替代传统树模型流程。

  2. Hugging Face Blog60

    Hugging Face 模型页展示 Every Eval Ever 评测结果

    Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,评测结果可交叉发布并链接回完整记录。EEE 数据存储已收录约 229,000 条评测结果,覆盖 22,000 多个模型和 2,200 个基准,来自 31 种报告格式。

    推荐理由:原文给出 EEE 与 Community Evals 互通后的数据规模与转换工具,读者可据此判断评测结果如何被统一记录和追溯。

6月26日周五
6月25日周四
  1. Hugging Face Blog60

    NVIDIA NeMo AutoModel 发布,MoE 微调吞吐提升 3.4-3.7 倍

    NVIDIA 发布开源库 NeMo AutoModel,在 HuggingFace Transformers v5 之上加入 Expert Parallelism、DeepEP 融合 all-to-all 调度和 TransformerEngine 内核,微调 MoE 模型时训练吞吐提升 3.4-3.7 倍、GPU 显存减少 29-32%。

    推荐理由:原文给出同一 from_pretrained() API 下的吞吐与显存对比数据,读者可据此判断 MoE 微调的迁移成本。

6月24日周三
6月22日周一
6月18日周四
6月17日周三
6月11日周四
6月9日周二
  1. Google DeepMind78

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本电脑的智能体多模态模型,介于边缘端 E4B 与 26B MoE 之间,是首个支持原生音频输入的中等规模 Gemma 模型。

    推荐理由:Gemma 4 12B 用无编码器架构把视觉与音频直接接入 LLM 主干,读者可据此判断本地多模态智能体的硬件门槛。

6月8日周一
  1. Hugging Face Blog66

    OpenEnv 转为委员会共管,成为智能体强化学习的开源协议层

    Hugging Face 宣布 OpenEnv 改由委员会协调,成员包括 Meta-PyTorch、Reflection、Unsloth、Modal、Prime Intellect、Nvidia、Mercor、Fleet AI、Microsoft、Hugging Face 和 RadixArk,项目迁至 huggingface/OpenEnv。

    推荐理由:OpenEnv 从单一项目转为多方共管的协议层,读者可据此了解开源智能体强化学习环境的标准化路径。

6月5日周五
6月4日周四
  1. Hugging Face Blog62

    Hugging Face 将 hf CLI 重构为面向智能体优化的 Hub 命令行工具

    Hugging Face 重构官方命令行工具 hf CLI,使其同时适配人类用户和 Claude Code、Codex、Cursor 等编码智能体,新增 agent 模式输出、下一步命令提示和非阻塞重试机制。

    推荐理由:官方给出 hf CLI 面向智能体重构的细节与基准数据,可据此判断命令行工具该如何适配编码智能体。

  2. Google Research62

    Google 开源洪水预报水文建模框架

    Google Research 在 GitHub 上以 Apache 2.0 协议开源其水文建模框架,供各国气象与水文机构将 AI 洪水预报接入自身工作流。该框架是基于 PyTorch 的 Python 包,采用 LSTM 网络架构,可用开源 Caravan 数据集训练,并支持加入本地数据微调。

    推荐理由:Google 开源其洪水预报水文建模框架,读者可了解模型架构、训练数据与业务化接入方式。

6月3日周三
6月2日周二
  1. Hugging Face Blog72

    H Company 发布 Holo3.1 计算机使用智能体模型家族

    H Company 发布 Holo3.1 计算机使用智能体模型家族,基于 Qwen 系列,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重。

    推荐理由:Holo3.1 给出跨环境与跨框架的鲁棒性提升,并首次提供量化权重,读者可据此判断本地部署计算机使用智能体的可行路径。

6月1日周一
  1. Hugging Face Blog60

    JetBrains 发布 Mellum2:12B 混合专家模型

    JetBrains 发布 Mellum2,一个从零训练的 12B 参数混合专家(MoE)模型,覆盖自然语言与代码,每个 token 仅激活 2.5B 参数,采用 Apache 2.0 许可。官方称其面向路由、RAG、摘要、子智能体和高吞吐编码等低延迟场景,相比同规模模型推理速度提升超过 2 倍,模型已在 Hugging Face 开放下载,技术报告发布于 arXiv。

    推荐理由:JetBrains 开源 12B MoE 模型,每 token 仅激活 2.5B 参数,可据此判断轻量模型在路由与 RAG 场景的部署取舍。

5月28日周四
  1. Mistral AI71

    Mistral AI 发布 Search Toolkit 公开预览版

    Mistral AI 发布 Search Toolkit 公开预览版,这是一个用于构建 AI 应用生产级搜索管线的可组合框架,将数据摄取、检索和评测整合到共享接口下,开源并支持云端、本地和边缘部署。

    推荐理由:原文给出检索管线的统一框架与内置评测指标,读者可据此判断自建 RAG 检索栈的整合成本。

5月27日周三
  1. Hugging Face Blog75

    Hugging Face 在 TRL 中实现增量权重同步,用 Hub Bucket 传输万亿参数模型

    Hugging Face 在 TRL 中落地增量权重同步(Delta Weight Sync):只把 RL 优化器步之间真正变化的 bf16 权重编码成稀疏 safetensors 文件上传到 Hub Bucket,再由 vLLM 拉取应用。

    推荐理由:TRL 把稀疏增量权重同步做成了可 pip 安装的实现,读者可据此判断跨机房异步 RL 训练的部署成本。

5月22日周五
  1. Mistral AI80

    Mistral 发布 Mistral Medium 3.5 与 Vibe 云端远程智能体

    Mistral 发布 Mistral Medium 3.5,一个 128B 稠密模型,以修改版 MIT 许可开放权重,成为 Mistral Vibe 和 Le Chat 的默认模型,并支撑 Vibe 的云端远程编码智能体与 Le Chat 的 Work 模式预览。

    推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 权重,读者可据此判断自托管编码智能体的可行边界。

5月20日周三
5月19日周二
5月15日周五
5月14日周四
4月29日周三
  1. Hugging Face Blog62

    Granite 4.1 LLM 是如何构建的:IBM 公开预训练、SFT 与强化学习全流程

    IBM Granite 团队发布技术文章,详解 Granite 4.1 系列(3B、8B、30B 稠密 decoder-only 模型)的构建流程:约 15T token 五阶段预训练、上下文扩展至 512K、约 4.1M 高质量样本的 SFT,以及基于 on-policy GRPO 与 DAPO loss 的多阶段强化学习。

    推荐理由:Granite 团队公开了从数据配比到多阶段 RL 的完整训练细节,可对照其 8B 稠密模型追平 32B MoE 的取舍。