如何用 Transformers 和 Tokenizers 从零训练一个新语言模型
Hugging Face 发布教程,演示如何用 transformers 和 tokenizers 库从零训练一个 84M 参数的小型语言模型 EsperBERTo,并在世界语上完成词性标注微调。
Hugging Face 发布教程,演示如何用 transformers 和 tokenizers 库从零训练一个 84M 参数的小型语言模型 EsperBERTo,并在世界语上完成词性标注微调。
OpenAI 发布关于神经语言模型缩放定律的研究,探讨模型性能与规模之间的关系。原文正文未能抓取,仅标题可用。
OpenAI 发现双重下降现象同样出现在 CNN、ResNet 和 Transformer 中:随着模型规模、数据量或训练时间增加,性能先提升、再变差、然后再次提升。这一效应通常可通过精细的正则化避免,但研究者尚不完全理解其成因,认为值得进一步研究。
OpenAI 发布 Procgen Benchmark,包含 16 个易于使用的程序化生成环境,用于直接衡量强化学习智能体学习可泛化技能的速度。
OpenAI 训练了一对神经网络,让类人机械手解开魔方,训练完全在仿真中完成,使用与 OpenAI Five 相同的强化学习代码,并搭配名为 Automatic Domain Randomization(ADR)的新技术。该系统能应对训练中从未见过的情况,例如被毛绒长颈鹿戳碰,说明强化学习不只适用于虚拟任务,也能解决需要极高灵巧度的物理世界问题。
推荐理由:OpenAI 用同一套强化学习代码加 ADR 在仿真中训练机械手解魔方,可观察仿真到真实世界的迁移思路。
OpenAI 用人类反馈对 774M 参数的 GPT-2 语言模型进行微调,在多项任务上成功匹配外部人类标注者的偏好,但这些偏好并不总与 OpenAI 自己的预期一致。在摘要任务中,标注者偏好直接照抄输入的句子,模型因此学会了复制;摘要任务需要 6 万条人类标注,而按不同风格续写文本等更简单的任务只需 5 千条。OpenAI 表示其动机是让安全技术更接近“机器与人对话”这一通用任务。
推荐理由:OpenAI 用人类反馈微调 GPT-2 的早期实验,展示了偏好数据如何影响模型行为,也暴露了标注偏好与研究者预期的偏差。
OpenAI 在能量模型(EBM)的稳定可扩展训练上取得进展,其样本质量和泛化能力优于现有模型。EBM 生成时投入更多算力持续精修结果,在低温度下可生成与 GAN 媲美的样本,同时具备似然类模型的模式覆盖保证。
OpenAI 与 Google 研究人员合作推出 Activation Atlases,一种可视化神经元之间交互所代表含义的新技术。随着 AI 系统被部署到日益敏感的场景,更好地理解其内部决策过程有助于识别弱点和调查失败原因。
OpenAI 训练了一个大规模无监督语言模型,能够生成连贯的段落文本,在多项语言建模基准上取得当时最好成绩。该模型无需针对特定任务训练,即可完成基础的阅读理解、机器翻译、问答和摘要任务。
推荐理由:OpenAI 官方披露一个大规模无监督语言模型,在多项语言建模基准上取得当时最好成绩,并零样本完成阅读理解、翻译、问答与摘要。
OpenAI 发现梯度噪声尺度这一统计指标能预测神经网络训练在多种任务上的可并行性。由于复杂任务的梯度噪声更大,未来更大的 batch size 可能变得有用,从而消除 AI 系统继续扩展的一项潜在限制。该结果表明神经网络训练并非神秘技艺,而是可以被严格化和系统化的。
OpenAI 开发出一种基于能量的模型,仅需五次演示即可学会识别并生成以 2D 点集表达的概念,如 near、above、between、closest 和 furthest。该模型还展现出跨域迁移能力:在 2D 粒子环境中学会的概念可用于解决 3D 物理机器人的任务。
OpenAI 用 Transformer 结合无监督预训练的可扩展、任务无关系统,在多项语言任务上取得当时最优结果,并对外发布了该系统。OpenAI 表示,这一结果说明监督学习方法与无监督预训练相结合效果很好,希望推动在更大、更多样的数据集上继续探索这一思路。
推荐理由:OpenAI 用 Transformer 加无监督预训练在多项语言任务上取得当时最优结果,并公开了这套可扩展系统。
OpenAI 发布强化学习游戏研究平台 Gym Retro 的完整版,公开游戏数量从约 70 款 Atari 游戏和 30 款 Sega 游戏扩展到覆盖多种模拟器的 1000 多款游戏。同时发布的还有用于向该平台添加新游戏的工具。
OpenAI 发布一项分析,指出自 2012 年以来最大规模 AI 训练所用算力呈指数增长,翻倍周期为 3.4 个月,而摩尔定律的翻倍周期为 2 年。同一时期该指标增长超过 300,000 倍,若按 2 年翻倍则仅增长 7 倍。OpenAI 表示算力提升是 AI 进展的关键组成部分,若这一趋势延续,值得为远超当前能力的系统做准备。
推荐理由:OpenAI 用一组量化数据说明最大规模 AI 训练算力的增长节奏,可与摩尔定律对照理解算力趋势。
OpenAI 发布实验性元学习方法 Evolved Policy Gradients(EPG),通过进化学习智能体的损失函数,使其能在新任务上快速训练。经 EPG 训练的智能体在测试时可完成训练范围之外的基础任务,例如学会导航到房间中与训练时位置相反一侧的物体。
OpenAI 开发出可扩展的元学习算法 Reptile,通过反复采样任务、对其执行随机梯度下降,并将初始参数朝该任务最终学到的参数更新。Reptile 是将 Shortest Descent 算法应用于元学习场景,数学上与一阶 MAML 相似,只需黑盒访问 SGD 或 Adam 等优化器,计算效率与性能相近。
OpenAI 设计了一种让 AI 互相教学的方法,所选取的示例同样能被人类理解。该方法自动挑选最具信息量的示例来教授某个概念,例如用最能描述"狗"这一概念的图像,实验显示它对 AI 教学有效。
OpenAI 构建了一套实体消歧系统,通过神经网络判断一个词是否属于约 100 个自动发现的"类型"(非互斥类别),从而自动确定该词指代的是哪个对象。
OpenAI 开发出一种分层强化学习算法,能学习有助于解决一系列任务的高层动作,从而快速求解需要数千个时间步的任务。在导航问题集上,该算法发现了向不同方向行走和爬行的高层动作,使智能体能够快速掌握新的导航任务。
OpenAI 展示在模拟机器人摔跤任务中,元学习智能体能够快速击败更强的非元学习智能体,并能适应物理故障。
OpenAI 发现,向强化学习算法的参数中加入自适应噪声,往往能提升性能。这种探索方法实现简单,且极少导致性能下降,因此值得在任何问题上尝试。
OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),其表现与当时最先进方法相当或更好,同时实现和调参都简单得多。PPO 因易用且性能良好,已成为 OpenAI 默认的强化学习算法。
推荐理由:OpenAI 公开 PPO 算法并说明其相比当时 SOTA 更易实现和调参,可了解该方法的提出背景。
OpenAI 开源内部项目 OpenAI Baselines,目标是以与已发表结果相当的性能复现强化学习算法。首批发布包含 DQN 及其三个变体,其余算法将在接下来几个月内陆续放出。
推荐理由:OpenAI 开源内部强化学习复现项目 Baselines,首批放出 DQN 及三个变体,可了解其复现思路与后续发布节奏。
OpenAI 开发了一个无监督系统,仅通过预测 Amazon 评论文本中的下一个字符进行训练,却学到了对情感的良好表征。
OpenAI 发现,已有数十年历史的进化策略(ES)在现代强化学习基准(如 Atari/MuJoCo)上性能可与标准强化学习(RL)技术相媲美,同时规避了 RL 的诸多不便。
OpenAI 指出深度学习是一门经验科学,团队基础设施的质量是进展的倍增器。当前开源生态已让任何人都能搭建出色的深度学习基础设施。