跳到正文
Hugging Face Blog·· 2026-01-20精选AI 评分62

微软发布 Differential Transformer V2:差分注意力去掉自定义 kernel 与 RMSNorm

Differential Transformer V2

AI 导读

微软 unilm 团队发布 Differential Transformer V2(DIFF V2),在保持 KV 头数量不变的前提下把 query 头数翻倍,使解码速度与标准 Transformer 持平,且不再需要自定义注意力 kernel。

推荐理由

微软团队给出 DIFF V2 的代码与消融对比,读者可据此理解差分注意力在解码速度与训练稳定性上的取舍。

来源:Hugging Face Blog · huggingface.co