跳到正文

公司与模型

Hugging Face 最新动态

Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。

226 条精选近 30 天 6 条共收录 741 条

更新

精选归档 · 第 11 页

2月10日周五第 201–220 条
1月26日周四
1月24日周二
12月9日周五
  1. Hugging Face Blog62

    图解基于人类反馈的强化学习 RLHF

    Hugging Face 发布图解 RLHF 的教程文章,把训练流程拆成预训练语言模型、收集偏好数据训练奖励模型、用 PPO 微调语言模型三个核心步骤。文章指出奖励模型输出标量奖励,训练时用 KL 散度惩罚约束策略偏离初始模型,并介绍了 TRL、TRLX、RL4LMs 等开源 RLHF 工具。文中还提到人类标注成本高、标注者意见不一致等局限,以及离线 RL、ILQL 等尚未充分探索的方向。

    推荐理由:把 RLHF 拆成预训练、奖励模型、PPO 微调三步,并梳理了开源实现与已知局限,适合作为入门框架参考。

12月1日周四
11月7日周一
10月19日周三
  1. Hugging Face Blog62

    Hugging Face 发布 MTEB 大规模文本嵌入基准

    Hugging Face 发布 MTEB,一个衡量文本嵌入模型在多种嵌入任务上表现的基准,包含 8 类任务、56 个数据集,覆盖最多 112 种语言,榜单已汇总超过 2000 条结果。

    推荐理由:MTEB 把 56 个数据集、8 类任务和 112 种语言汇总到同一榜单,读者可据此理解文本嵌入模型的评测维度与取舍。

10月13日周四
9月27日周二
  1. Hugging Face Blog62

    Accelerate 如何借助 PyTorch 运行超大模型

    Hugging Face 撰文解释 Accelerate 如何借助 PyTorch 在内存和显存不足的消费级硬件上加载并运行超大模型。它先用 meta device 创建空模型并计算 device map,再按分片逐步加载权重,把层分配到多张 GPU、CPU 内存乃至磁盘,最后通过 hooks 在每次前向传播前后搬运权重。

    推荐理由:原文拆解了 Accelerate 借助 PyTorch meta device 与分片加载在有限显存下跑大模型的完整流程,可迁移到自己的推理部署。

9月26日周一
9月12日周一
  1. Hugging Face Blog62

    Hugging Face 发布 diffusers 0.3,新增图生图与文本反转等能力

    Hugging Face 发布 diffusers 0.3,为扩散模型工具箱新增图生图、文本反转、实验性修复(inpainting)等流水线,并加入面向小显存的优化,Stable Diffusion 显存占用可降至 3.2GB,代价是约 10% 的速度损失。

    推荐理由:diffusers 0.3 集中补齐图生图、文本反转、修复与低显存优化,可据此判断扩散模型工具链的成熟度。

8月22日周一
8月17日周三
7月12日周二
  1. Hugging Face Blog82

    Hugging Face 发布 176B 参数开源多语言模型 BLOOM

    Hugging Face 发布 BLOOM,一个 176B 参数的多语言大语言模型,可生成 46 种自然语言和 13 种编程语言的文本,对西班牙语、法语、阿拉伯语等多数语言是首个超过 100B 参数的语言模型。

    推荐理由:BLOOM 以 176B 参数覆盖 46 种自然语言并公开训练中间检查点,为研究大模型内部机制提供了少见的开放样本。

6月28日周二
  1. Hugging Face Blog60

    Hugging Face 发布 Evaluation on the Hub,可在 Hub 上免代码评测任意模型

    Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,用户无需写代码即可在 Hub 上用任意数据集和指标评测模型。评测结果会以 PR 形式写入模型卡的元数据,并可在数据集页查看排行榜;官方已用该工具评测数百个模型并提交了对应 PR。工具支持为任务寻找最佳模型、在新数据集上跑基线、以及用多个相关数据集评测自己的模型三种场景。

    推荐理由:Hugging Face 把模型评测做成 Hub 上的一键流程,读者可了解免代码评测与结果写入模型卡的做法。

6月7日周二
5月16日周一
  1. Hugging Face Blog62

    Gradio 3.0 发布,推出 Blocks 低层 API

    Gradio 发布 3.0 版本,对库进行彻底重设计,前端改用 Svelte 等现代技术,页面加载更快、体积更小,并新增 Gallery 组件和 TabbedInterface 类。

    推荐理由:Gradio 3.0 重写前端并推出 Blocks 低层 API,读者可了解它如何让 Python 直接搭建复杂自定义 Web 应用。

5月9日周一
  1. Hugging Face Blog62

    Hugging Face 完成 1 亿美元 C 轮融资

    Hugging Face 宣布完成 1 亿美元 C 轮融资,由 Lux Capital 领投,Sequoia、Coatue 等参与。官方称平台已托管 10 万个预训练模型和 1 万个数据集,超过 1 万家公司使用其产品,团队在过去 12 个月从 30 人增至 120 多人。资金将用于加大研究、开源、产品投入以及负责任地推动 AI 民主化。

    推荐理由:Hugging Face 官方披露 C 轮融资规模、投资方与平台模型数据集数量,可据此了解其开源生态位置。

12月21日周二
  1. Hugging Face Blog62

    Gradio 加入 Hugging Face

    Hugging Face 收购机器学习初创公司 Gradio,Gradio 联合创始人以第一人称宣布这一消息。Gradio 于 2019 年由斯坦福博士生与三位室友发布,用于让机器学习工程师快速构建和分享模型 demo,目前已有超过 30 万个 demo 基于该库搭建。作者表示加入 Hugging Face 后将继续发展 Gradio,让任何有浏览器和网络的人都能使用机器学习,并提到团队正在招聘。

    推荐理由:Gradio 创始人以第一人称讲述被 Hugging Face 收购的经过,并回顾该库从 2019 年起步到 30 万 demo 的历程。

12月15日周三
  1. Hugging Face Blog62

    Hugging Face 将 Perceiver IO 加入 Transformers,支持任意模态

    Hugging Face 在 Transformers 库中加入 Perceiver IO,这是首个可处理文本、图像、音频、视频、点云及其组合的 Transformer 类模型,并随附示例 Space 与 notebook。

    推荐理由:Hugging Face 把 Perceiver IO 接入 Transformers,读者可了解这套架构如何用 latent 空间统一处理文本、图像、音频与光流。