用 DeepSpeed 和 Accelerate 实现极快的 BLOOM 推理
Hugging Face 发布教程,展示如何用 DeepSpeed-Inference、Accelerate 和 DeepSpeed ZeRO 为 176B 参数的 BLOOM 做推理,并给出 8x80GB A100 上的吞吐基准。
Hugging Face 发布教程,展示如何用 DeepSpeed-Inference、Accelerate 和 DeepSpeed ZeRO 为 176B 参数的 BLOOM 做推理,并给出 8x80GB A100 上的吞吐基准。
Hugging Face 详解 176B 参数多语言模型 BLOOM 的训练技术:基于 Megatron-DeepSpeed 的 3D 并行方案,使用 384 张 80GB A100 GPU、350B token 的 46 种语言数据,训练耗时约 3.5 个月。模型架构接近 GPT3 并做了若干改进,词表规模 250,680,训练在法国 Jean Zay 超算上完成。
微软提出 TAPEX,通过让 BART 学习执行合成 SQL 查询来实现表格预训练,无需真实标注数据。该方法在 WikiSQL、TabFact、SQA 和 WikiTableQuestions 四个基准上均取得 SOTA,其中 WikiSQL 准确率达 89.6%,WikiTableQuestions 达 57.5%。
Hugging Face 发布机器学习专家访谈,嘉宾 Margaret Mitchell 曾任 Google 伦理 AI 团队创始人兼联合负责人,现于 Hugging Face 负责伦理 AI 研究协议与包容性招聘。她因在微软 Seeing AI 项目中目睹模型将爆炸场景描述为"美丽景色"而转向伦理 AI,并指出 ML 团队普遍缺乏对偏见概念的认知与沟通词汇。
微软和 NVIDIA 发布 Megatron-Turing NLG 530B,号称全球最大最强的生成式语言模型,但训练需数百台 DGX A100 服务器、成本近 1 亿美元。作者质疑这类超大模型趋势:基准提升有限,却带来高昂成本、复杂度和碳足迹,并建议改用预训练模型、更小模型(如 DistilBERT 保留 97% 语言理解、体积小 40%、速度快 60%)和微调。
OpenAI 宣布已同意将 GPT-3 授权给 Microsoft,用于其自有产品和服务。材料未披露授权范围、金额或具体产品形态。
推荐理由:OpenAI 将 GPT-3 授权给 Microsoft 用于其自有产品与服务,可据此观察早期大模型商业授权路径。
微软向OpenAI投资10亿美元,支持其构建通用人工智能(AGI)。双方将在Microsoft Azure上合作开发可扩展至AGI的硬件和软件平台,联合研发新的Azure AI超算技术,微软同时成为OpenAI的独家云服务提供商。
推荐理由:微软10亿美元投资OpenAI并成为其独家云服务商,读者可了解双方在Azure上共建AGI平台的早期合作框架。
OpenAI 正与 Microsoft 合作,将其大部分大规模实验放到 Azure 上运行。