跳到正文
Hugging Face Blog·· 2021-03-31AI 评分40

深入理解 BigBird 的块稀疏注意力机制

Understanding BigBird's Block Sparse Attention

AI 导读

Hugging Face 发文详解 BigBird 的块稀疏注意力机制,该模型通过滑动注意力、全局 token 和随机 token 三种方式近似 BERT 的完整注意力,可处理长达 4096 的序列,计算成本远低于 BERT,并已在长文档摘要、长上下文问答等任务上取得 SOTA。BigBird 的 RoBERTa 类模型现已集成到 Transformers 中。

来源:Hugging Face Blog · huggingface.co