跳到正文
1月14日周三
1月10日周六
  1. Berkeley AI Research22

    伯克利提出信息驱动成像系统设计框架,登 NeurIPS 2025

    伯克利 AI 研究团队提出一种基于互信息的成像系统评估与优化框架,可直接从带噪测量中估计信息量,无需重建算法或任务专用解码器。该方法在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证,信息估计能预测下游解码性能,优化后的设计达到 SOTA 端到端方法水平,且内存和算力需求更低。相关论文发表于 NeurIPS 2025。

1月6日周二
  1. Hugging Face Blog66

    NVIDIA 发布 Cosmos Reason 2,面向物理 AI 的开源推理视觉语言模型

    NVIDIA 发布 Cosmos Reason 2,一款面向物理 AI 的开源推理视觉语言模型,在 Physical AI Bench 和 Physical Reasoning 榜单上位列开源模型第一。

    推荐理由:NVIDIA 开源视觉语言推理模型 Cosmos Reason 2 的发布细节,含 256K 上下文与 2B/8B 规格,可对照上一代判断物理 AI 推理能力进展。

1月5日周一
12月23日周二
  1. Hugging Face Blog42

    AprielGuard:面向现代 LLM 系统安全与对抗鲁棒性的 8B 防护模型

    Hugging Face 发布 8B 参数安全防护模型 AprielGuard,可检测 16 类安全风险及提示注入、越狱、思维链污染、记忆投毒、多智能体攻击等对抗攻击,并覆盖工具调用与推理轨迹等智能体工作流。模型提供推理与非推理两种模式,兼顾可解释分类与低延迟生产部署。

12月18日周四
  1. Hugging Face Blog36

    Transformers v5 重构 Tokenization:更简单、更清晰、更模块化

    Hugging Face 发布 Transformers v5,将 tokenizer 架构与训练词表分离,类似 PyTorch 分离网络结构与权重,使 tokenizer 可检查、可定制、可从零训练。v5 提供清晰的类层级和单一快速后端,支持 BPE、Unigram、WordPiece 等算法,并可通过 AutoTokenizer 自动选择正确的 tokenizer 类。

12月16日周二
  1. Google DeepMind62

    Google DeepMind 发布 Gemma Scope 2 可解释性工具套件

    Google DeepMind 发布 Gemma Scope 2,一套面向 Gemma 3 全系列(270M 至 27B 参数)的开源可解释性工具。该套件结合稀疏自编码器(SAEs)与 transcoders,覆盖模型每一层,并新增 skip-transcoders、跨层 transcoders 及针对聊天版本的越狱、拒答和思维链忠实度分析工具。

    推荐理由:Gemma Scope 2 覆盖 Gemma 3 全系列并公开工具与演示,读者可了解可解释性工具在模型安全审计上的最新进展。

12月11日周四
  1. Hugging Face Blog60

    llama.cpp 新增模型管理功能:router 模式支持动态加载与切换模型

    llama.cpp server 新增 router 模式,可在不重启服务的情况下动态加载、卸载和切换多个模型。该模式采用多进程架构,每个模型独立运行,单个模型崩溃不影响其他模型;支持自动发现缓存或 --models-dir 目录中的 GGUF 文件、按需加载、LRU 淘汰(默认 --models-max 为 4)以及按请求中的 model 字段路由。

    推荐理由:llama.cpp 新增 router 模式,可在不重启服务的前提下动态加载、卸载和切换多个模型,适合本地多模型部署场景。

12月9日周二
  1. Mistral AI80

    Mistral 发布 Devstral 2 编码模型家族与 Vibe CLI

    Mistral 发布 Devstral 2 编码模型家族,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,均开源,前者采用修改版 MIT 许可,后者采用 Apache 2.0。

    推荐理由:官方给出两款开源编码模型的参数、许可与 SWE-bench 成绩,并附独立人工评测对比,可据此判断开源编码模型与闭源模型的差距。

12月5日周五
12月4日周四
12月3日周三
  1. Mistral AI80

    Mistral 发布 Mistral 3 系列,含 675B 参数 Mistral Large 3 与 3B/8B/14B Ministral 3

    Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个稠密小模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。

    推荐理由:Mistral 3 全系以 Apache 2.0 开源并给出 NVFP4 量化与多平台部署路径,可据此判断开源前沿模型的落地成本。

12月1日周一
  1. Hugging Face Blog72

    Hugging Face 发布 Transformers v5,主打互操作性

    Hugging Face 发布 Transformers v5.0.0rc-0,主题是互操作性,官方称该库目前每天通过 pip 安装超过 300 万次、累计安装量超 12 亿次,模型架构从 v4 时的 40 个增至 400 多个。

    推荐理由:官方给出 v5 在简化模型定义、训练与推理上的取舍,读者可据此判断自家训练和部署链路要不要跟进。

11月25日周二
11月21日周五
  1. Hugging Face Blog62

    Hugging Face TRL 集成 RapidFire AI,微调实验提速最高 20 倍

    Hugging Face TRL 正式集成 RapidFire AI,用户可用 RFSFTConfig、RFDPOConfig、RFGRPOConfig 近乎零代码替换原有 SFT/DPO/GRPO 配置,在单张 GPU 上并发运行多组微调配置。

    推荐理由:官方集成给出了并发调度与实时控制的具体机制和基准数字,可据此判断微调实验流程能压缩多少时间。

11月20日周四
11月19日周三
11月17日周一
11月14日周五
11月12日周三
  1. Google Research49

    Google 发布 JAX-Privacy 1.0:面向大规模机器学习的差分隐私工具库

    Google 发布 JAX-Privacy 1.0,这是构建在 JAX 之上、用于训练和审计差分隐私(DP)模型的工具库,重新设计以提升模块化。它提供逐样本梯度裁剪、噪声添加、数据批构建等核心组件,支持 DP-SGD、DP-FTRL 及 DP matrix factorization 等算法,并借助 JAX 的 vmap、shard_map 实现数据与模型并行的大规模训练。

10月31日周五
10月30日周四
10月29日周三
  1. Hugging Face Blog62

    NVIDIA Isaac for Healthcare 如何从仿真到部署构建医疗机器人

    NVIDIA 发布 Isaac for Healthcare v0.4,提供基于 SO-ARM 的端到端手术辅助机器人工作流,覆盖数据采集、训练与真机部署。该工作流用 LeRobot 采集仿真与真机数据,后训练 GR00T N1.5,并在 Isaac Lab 评估后部署到硬件,其中超过 93% 的训练数据由仿真合成生成。

    推荐理由:原文给出从仿真采集、GR00T N1.5 后训练到真机部署的完整命令与硬件要求,可据此复现医疗机器人工作流。

10月28日周二
  1. Hugging Face Blog38

    Hugging Face 提出“语音同意门”:让声音克隆必须先获得本人同意

    Hugging Face 发布博客提出“语音同意门”(voice consent gate),让模型只有在说话人明确说出同意语句并被 ASR 识别后才启动声音克隆,并提供了示例 Space 和配套代码。该方案由语言模型为每次授权生成一对全新句子,一句表达明确同意、一句提供语音多样性,从而把同意变成可追溯、可审计的系统前置条件。

10月27日周一
  1. Hugging Face Blog62

    Hugging Face 将流式数据集效率提升 100 倍

    Hugging Face 改进 datasets 库的流式加载,load_dataset(streaming=True) 的启动请求最多减少 100 倍、数据文件解析快 10 倍、流式速度最多快 2 倍,256 并发 worker 下无崩溃。

    推荐理由:原文给出流式加载的具体优化项与实测倍数,读者可据此判断大规模训练的数据读取成本能降到什么程度。

  2. Hugging Face Blog62

    Hugging Face 发布 huggingface_hub v1.0

    Hugging Face 发布 huggingface_hub v1.0,这是该 Python 库五年来的首个大版本,引入破坏性变更。主要变化包括后端从 requests 迁移到 httpx、以基于 Typer 的 hf CLI 取代已弃用的 huggingface-cli、文件传输全面改用 hf_xet 替代 hf_transfer。

    推荐理由:官方梳理了 v1.0 的破坏性变更与迁移路径,读者可据此判断升级自家依赖库的时机与成本。

10月24日周五
10月23日周四
  1. Hugging Face Blog71

    Meta 与 Hugging Face 联合推出 OpenEnv Hub 智能体环境共享平台

    Meta 与 Hugging Face 合作推出 OpenEnv Hub,一个面向智能体环境的开放社区共享平台,开发者可构建、分享和探索兼容 OpenEnv 的环境,用于训练和部署。

    推荐理由:Meta 与 Hugging Face 联合推出智能体环境共享 Hub,并同步开放 0.1 规范草案,读者可据此了解智能体训练与部署的开放协作方式。

10月21日周二
  1. Hugging Face Blog58

    Hugging Face AI Sheets 新增图像支持

    Hugging Face 为开源工具 AI Sheets 发布重大更新,新增视觉能力,可在表格中查看、分析、提取图像信息,并生成和编辑图片,全程无需写代码。图像列支持描述分类、抽取结构化数据(如收据商户名、日期、金额)和添加元数据,文本列与图像列可在同一工作流中生成与转换内容,结果可导出为 CSV、Parquet 或上传至 Hub。

10月17日周五
  1. Hugging Face Blog38

    Hugging Face 发起 AI for Food Allergies 项目:用 AI 推进食物过敏研究

    Hugging Face 发起 AI for Food Allergies 项目,计划建设首个社区驱动的研究实验室,探索 AI 如何推进食物过敏研究。全球约 2.2 亿人患有至少一种食物过敏,美国约占总人口 10%。项目将连接前沿 AI 与生物医学,开发开放协作项目,服务研究者、临床医生和患者。

10月14日周二
10月7日周二
  1. Hugging Face Blog60

    BigCode 发布 BigCodeArena:通过代码执行端到端评测代码生成模型

    BigCode 项目发布 BigCodeArena,这是首个通过实际执行代码来评测代码生成模型的人类参与平台,用户可提交编程任务、对比两个模型的生成结果并运行代码后投票。

    推荐理由:BigCodeArena 把代码执行结果引入人类投票评测,读者可据此了解代码模型评测为何需要运行而非只看源码。

9月29日周一
9月26日周五
9月23日周二
  1. Hugging Face Blog49

    Hugging Face 发布 Smol2Operator:用两阶段后训练让 SmolVLM2-2.2B 学会 GUI 操作

    Hugging Face 发布 Smol2Operator,基于 SmolVLM2-2.2B-Instruct 通过两阶段训练将其从零 GUI 定位能力打造成可执行点击、输入等操作的智能体式 GUI coder。第一阶段先建立界面元素定位能力,第二阶段用 SFT 增强智能体推理,在 ScreenSpot-v2 基准上评估,并开源全部训练配方、数据处理工具、模型、demo 与数据集。