跳到正文
1月20日周五
1月19日周四
  1. Hugging Face Blog42

    Hugging Face transformers 集成 Mask2Former 与 OneFormer,统一图像分割

    Mask2Former 和 OneFormer 两款统一图像分割模型现已集成到 Hugging Face 开源库 transformers 中。Mask2Former 用同一架构解决实例、语义和全景分割,但需分任务训练;OneFormer 仅在全景数据上训练一次即可在三个任务上达到 SOTA,代价是额外的文本编码器带来更高延迟。作者已发布 30 个基于不同数据集训练的 checkpoint。

1月2日周一
12月9日周五
  1. Hugging Face Blog62

    图解基于人类反馈的强化学习 RLHF

    Hugging Face 发布图解 RLHF 的教程文章,把训练流程拆成预训练语言模型、收集偏好数据训练奖励模型、用 PPO 微调语言模型三个核心步骤。文章指出奖励模型输出标量奖励,训练时用 KL 散度惩罚约束策略偏离初始模型,并介绍了 TRL、TRLX、RL4LMs 等开源 RLHF 工具。文中还提到人类标注成本高、标注者意见不一致等局限,以及离线 RL、ILQL 等尚未充分探索的方向。

    推荐理由:把 RLHF 拆成预训练、奖励模型、PPO 微调三步,并梳理了开源实现与已知局限,适合作为入门框架参考。

12月2日周五
  1. Hugging Face Blog28

    蛋白质深度学习入门:从语言模型到 ESMFold 蛋白质折叠

    Hugging Face 发布面向生物学家与机器学习者的蛋白质深度学习入门文章,并附上微调蛋白质语言模型(PyTorch、TensorFlow)和用 ESMFold 做蛋白质折叠(仅 PyTorch)的示例 notebook。文章从 2018 年 ULMFiT 与 BERT 讲起,说明迁移学习如何把预训练知识复用到新任务,并指出其效果常相当于 100 倍以上的训练数据。

11月25日周五
11月21日周一
11月17日周四
  1. Hugging Face Blog42

    Hugging Face Spaces 与 arXiv 集成,论文页面新增 Demo 标签页

    Hugging Face 与 arXiv 合作,将 Spaces 通过 arXivLabs 集成到论文页面,新增 Demo 标签页,可直接链接社区或作者创建的开源演示。自 2021 年 10 月上线以来,Spaces 已托管超过 12,000 个开源机器学习演示,基于 Gradio 和 Streamlit 构建。以 BERT 论文为例,其 arXiv 页面已可找到 200 多个相关演示。

11月3日周四
  1. Hugging Face Blog62

    用 Transformers 微调 Whisper 实现多语言 ASR

    Hugging Face 发布教程,介绍如何用 Transformers 在任意多语言 ASR 数据集上微调 Whisper,涵盖 Common Voice 数据准备、特征提取器与 tokenizer 配置、训练评估及 Gradio 演示的完整代码。

    推荐理由:原文给出用 Transformers 微调 Whisper 的完整代码流程,并附 8 小时数据把 WER 从 63.5% 降到 32.0% 的实测结果。

10月21日周五
10月12日周三
10月7日周五
  1. Hugging Face Blog22

    Hugging Face 为模型和数据集引入 DOI

    Hugging Face 宣布用户可直接在 Hub 上为模型或数据集生成 DOI,该功能与 DataCite 合作实现,注册用户填写元数据后即可获得,他人可通过模型或数据集页面的“Cite this model/dataset”按钮引用。DOI 绑定对象的 URL、版本、创建日期等元数据,提供永久链接,模型或数据集新版本发布时 DOI 可更新,旧版本 DOI 随之失效。

9月22日周四
  1. Hugging Face Blog18

    Hugging Face 推出 Ethics and Society 季度通讯

    Hugging Face 发布首期 Ethics and Society 通讯,计划按季节在春分、秋分、夏至、冬至发布,由公司内部跨部门开放小组“Ethics and Society regulars”以平等身份共同编写。该通讯围绕协作、责任与透明等原则,分享 Hugging Face 在机器学习伦理落地方面的思考与项目实践,并明确不设统一价值观清单,而是持续输出项目层面的具体讨论。

9月21日周三
9月8日周四
8月31日周三
  1. Hugging Face Blog40

    Hugging Face 支持的 OpenRAIL:面向开放且负责任 AI 的许可框架

    RAIL Initiative 推出、Hugging Face 支持的 OpenRAIL 是一类 AI 专用许可,允许免版税获取、下游使用与再分发,同时嵌入针对特定关键场景的用途限制。它借鉴 BigScience、开源与 Creative Commons 的做法,试图在广泛开放与防范有害使用之间划出界线,并赋予许可方在模型被滥用时的执行能力。

8月24日周三
8月22日周一
8月17日周三
8月12日周五
8月10日周三
8月5日周五
8月3日周三
8月1日周一
7月14日周四
7月13日周三
6月29日周三
  1. Hugging Face Blog22

    如何用 Sentence Transformers 开启你的第一个机器学习项目

    Hugging Face 发布入门指南,以 Sentence Transformers(ST)为例讲解如何从零启动第一个机器学习项目。ST 可将句子、段落和图像转为嵌入向量,并用 util.cos_sim 计算余弦相似度,支持语义搜索、聚类和模型蒸馏等应用。该库在 GitHub 已获近 8,000 stars,超过 3,000 个项目依赖它。

6月22日周三
5月26日周四
5月25日周三
5月20日周五
  1. Hugging Face Blog22

    Hugging Face 深度强化学习课程:Q-Learning 入门(下)

    Hugging Face 深度强化学习课程第二单元第二部分讲解 Q-Learning 算法,并从头实现首个 RL 智能体。该算法属于 off-policy 的基于价值方法,采用 TD 方式训练动作价值函数,内部维护一张 Q-table 存储每个状态-动作对的价值。智能体将在 Frozen Lake v1 和自动驾驶出租车两个环境中训练,为第三单元的 Deep Q-Learning 打基础。

5月19日周四
  1. Hugging Face Blog18

    Hugging Face 多模态学习团队发布伦理章程,将伦理原则置于研究生命周期核心

    Hugging Face 多模态学习团队发布了一份伦理章程,将伦理原则正式纳入其机器学习研究生命周期的起点。章程列出了内容政策中要防止的滥用场景,包括生成虚假信息、生成个人身份信息以及在医疗、法律、金融等高风险领域的不谨慎使用。团队同时提出透明、开放可复现、公平、自我批判和尊重署名五项项目价值观,并承认这些价值观之间可能存在冲突,需逐案权衡。

5月17日周二
5月13日周五
5月9日周一
  1. Hugging Face Blog62

    Hugging Face 完成 1 亿美元 C 轮融资

    Hugging Face 宣布完成 1 亿美元 C 轮融资,由 Lux Capital 领投,Sequoia、Coatue 等参与。官方称平台已托管 10 万个预训练模型和 1 万个数据集,超过 1 万家公司使用其产品,团队在过去 12 个月从 30 人增至 120 多人。资金将用于加大研究、开源、产品投入以及负责任地推动 AI 民主化。

    推荐理由:Hugging Face 官方披露 C 轮融资规模、投资方与平台模型数据集数量,可据此了解其开源生态位置。

5月4日周三
5月2日周一
4月25日周一
  1. Hugging Face Blog22

    Hugging Face 推出教育计划:目标 2023 年底教会 500 万人机器学习

    Hugging Face 发布教育计划,目标在 2023 年底前教会 500 万人机器学习。该计划面向所有人、初学者和教师三类人群,提供 NLP、深度强化学习、Gradio 交互式 demo 等免费课程,以及已翻译成 8 种语言的教师工具包。此前 3 月的 ML demo.cratization tour 已为 16 个国家超 1000 名学生授课。

4月13日周三
4月12日周二