跳到正文
4月5日周二
  1. Hugging Face Blog22

    Hugging Face 详解 Transformers 为何不遵循 DRY 原则:单一模型文件策略

    Hugging Face 的 Transformers 库有意不遵循 DRY 原则,转而采用"单一模型文件策略",即模型前向传播所需的全部代码只放在一个 model 文件中,如 BERT 的 modeling_bert.py。原因是该库由开源社区共建、建模代码本身就是产品、机器学习领域演进极快且模型发布后基本静态不变,集中抽象反而会带来维护与命名难题。

3月22日周二
3月17日周四
3月2日周三
1月11日周二
11月30日周二
11月15日周一
10月20日周三
9月24日周五
9月14日周二
3月31日周三
  1. Hugging Face Blog40

    深入理解 BigBird 的块稀疏注意力机制

    Hugging Face 发文详解 BigBird 的块稀疏注意力机制,该模型通过滑动注意力、全局 token 和随机 token 三种方式近似 BERT 的完整注意力,可处理长达 4096 的序列,计算成本远低于 BERT,并已在长文档摘要、长上下文问答等任务上取得 SOTA。BigBird 的 RoBERTa 类模型现已集成到 Transformers 中。

3月23日周二
3月12日周五
3月9日周二
2月10日周三
2月9日周二
1月19日周二
11月2日周一
10月10日周六
  1. Hugging Face Blog22

    基于 Transformer 的编码器-解码器模型详解

    Hugging Face 发布博客,详解基于 Transformer 的编码器-解码器架构如何建模序列到序列问题,聚焦其数学定义与推理用法。文章将架构拆解为编码器和解码器两部分,并关联 🤗Transformers 中的 T5、Bart、MarianMT、Pegasus 等模型的实际推理。该文不涉及模型训练,仅提供背景与图示说明。

7月3日周五
6月20日周六
3月1日周日
2月14日周五