跳到正文
10月14日周五
10月13日周四
10月12日周三
9月27日周二
  1. Hugging Face Blog62

    Accelerate 如何借助 PyTorch 运行超大模型

    Hugging Face 撰文解释 Accelerate 如何借助 PyTorch 在内存和显存不足的消费级硬件上加载并运行超大模型。它先用 meta device 创建空模型并计算 device map,再按分片逐步加载权重,把层分配到多张 GPU、CPU 内存乃至磁盘,最后通过 hooks 在每次前向传播前后搬运权重。

    推荐理由:原文拆解了 Accelerate 借助 PyTorch meta device 与分片加载在有限显存下跑大模型的完整流程,可迁移到自己的推理部署。

9月16日周五
9月7日周三
8月24日周三
8月22日周一
8月19日周五
8月18日周四
8月17日周三
8月12日周五
8月11日周四
8月3日周三
8月2日周二
  1. Hugging Face Blog24

    Nyströmformer:用 Nyström 方法以线性时间与内存近似自注意力

    Nyströmformer 通过 Nyström 方法近似标准自注意力,将时间和内存复杂度从 O(n²) 降至 O(n)。它从 query 和 key 中用分段均值构造 landmark,仅需 32 或 64 个 landmark 即可在 n=4096 或 8192 的长序列上取得与标准自注意力及其他高效注意力机制相当的性能。该模型的原始实现与 HuggingFace 实现均已公开。

7月27日周三
7月25日周一
7月16日周六
  1. Hugging Face Blog30

    如何用对抗数据动态训练你的模型

    Hugging Face 博客介绍动态对抗数据收集(DADC):让用户用千奇百怪的手写数字骗过 SOTA 模型,再把骗成功的样本存下来继续训练,多轮重复。文中以 MNIST 手写数字识别为例,用 🤗 Spaces 搭建交互 demo,模型训练 20 个 epoch 后在测试集上达到 89% 准确率,并通过 flag 机制收集对抗样本。

7月14日周四
7月13日周三
6月28日周二
  1. Hugging Face Blog60

    Hugging Face 发布 Evaluation on the Hub,可在 Hub 上免代码评测任意模型

    Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,用户无需写代码即可在 Hub 上用任意数据集和指标评测模型。评测结果会以 PR 形式写入模型卡的元数据,并可在数据集页查看排行榜;官方已用该工具评测数百个模型并提交了对应 PR。工具支持为任务寻找最佳模型、在新数据集上跑基线、以及用多个相关数据集评测自己的模型三种场景。

    推荐理由:Hugging Face 把模型评测做成 Hub 上的一键流程,读者可了解免代码评测与结果写入模型卡的做法。

6月22日周三
6月15日周三
6月9日周四
6月2日周四
5月26日周四
5月24日周二
5月19日周四
5月16日周一
  1. Hugging Face Blog62

    Gradio 3.0 发布,推出 Blocks 低层 API

    Gradio 发布 3.0 版本,对库进行彻底重设计,前端改用 Svelte 等现代技术,页面加载更快、体积更小,并新增 Gallery 组件和 TabbedInterface 类。

    推荐理由:Gradio 3.0 重写前端并推出 Blocks 低层 API,读者可了解它如何让 Python 直接搭建复杂自定义 Web 应用。

5月10日周二
5月6日周五
5月2日周一
4月25日周一
4月22日周五
4月13日周三
4月12日周二
4月5日周二
  1. Hugging Face Blog22

    Hugging Face 详解 Transformers 为何不遵循 DRY 原则:单一模型文件策略

    Hugging Face 的 Transformers 库有意不遵循 DRY 原则,转而采用"单一模型文件策略",即模型前向传播所需的全部代码只放在一个 model 文件中,如 BERT 的 modeling_bert.py。原因是该库由开源社区共建、建模代码本身就是产品、机器学习领域演进极快且模型发布后基本静态不变,集中抽象反而会带来维护与命名难题。

3月16日周三