OpenAI 发布神经语言模型的缩放定律研究
OpenAI 发布关于神经语言模型缩放定律的研究,探讨模型性能与规模之间的关系。原文正文未能抓取,仅标题可用。
内容形态
值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。
136 条精选近 30 天 17 条共收录 493 条
OpenAI 发布关于神经语言模型缩放定律的研究,探讨模型性能与规模之间的关系。原文正文未能抓取,仅标题可用。
OpenAI 发布关于 Dota 2 大规模深度强化学习的研究,原文链接为 https://openai.com/index/dota-2-with-large-scale-deep-reinforcement-learning。
OpenAI 训练了一对神经网络,让类人机械手解开魔方,训练完全在仿真中完成,使用与 OpenAI Five 相同的强化学习代码,并搭配名为 Automatic Domain Randomization(ADR)的新技术。该系统能应对训练中从未见过的情况,例如被毛绒长颈鹿戳碰,说明强化学习不只适用于虚拟任务,也能解决需要极高灵巧度的物理世界问题。
推荐理由:OpenAI 用同一套强化学习代码加 ADR 在仿真中训练机械手解魔方,可观察仿真到真实世界的迁移思路。
OpenAI 用人类反馈对 774M 参数的 GPT-2 语言模型进行微调,在多项任务上成功匹配外部人类标注者的偏好,但这些偏好并不总与 OpenAI 自己的预期一致。在摘要任务中,标注者偏好直接照抄输入的句子,模型因此学会了复制;摘要任务需要 6 万条人类标注,而按不同风格续写文本等更简单的任务只需 5 千条。OpenAI 表示其动机是让安全技术更接近“机器与人对话”这一通用任务。
推荐理由:OpenAI 用人类反馈微调 GPT-2 的早期实验,展示了偏好数据如何影响模型行为,也暴露了标注偏好与研究者预期的偏差。
OpenAI 在模拟捉迷藏环境中训练智能体,观察到它们逐步学会使用更复杂的工具,并形成六种不同的策略与反策略,其中一些策略是该环境原本未被设计支持的。OpenAI 认为,这种在简单环境中自监督涌现出的复杂性,说明多智能体共同适应未来可能产生更复杂、更智能的行为。
推荐理由:OpenAI 在捉迷藏模拟环境中观察到智能体自发形成六种策略与反策略,可了解多智能体协同演化的一种研究路径。
OpenAI 开发了 Sparse Transformer,一种深度神经网络,在预测文本、图像或声音序列中下一个内容的任务上创下新纪录。它通过对注意力机制做算法改进,从比以往长 30 倍的序列中提取模式。
推荐理由:OpenAI 官方介绍 Sparse Transformer 对注意力机制的改进,可了解长序列建模在文本、图像和声音上的早期思路。
OpenAI 训练出一个智能体,仅凭单次人类演示就在《蒙特祖玛的复仇》中取得 74500 分的高分,超过此前所有已公布结果。其算法从演示中挑选特定状态作为起点,让智能体依次游玩并优化游戏得分,所用强化学习算法 PPO 也是 OpenAI Five 的基础。
推荐理由:OpenAI 用单次人类演示加 PPO 在《蒙特祖玛的复仇》上取得 74500 分,可了解演示驱动强化学习的早期思路。
OpenAI 用 Transformer 结合无监督预训练的可扩展、任务无关系统,在多项语言任务上取得当时最优结果,并对外发布了该系统。OpenAI 表示,这一结果说明监督学习方法与无监督预训练相结合效果很好,希望推动在更大、更多样的数据集上继续探索这一思路。
推荐理由:OpenAI 用 Transformer 加无监督预训练在多项语言任务上取得当时最优结果,并公开了这套可扩展系统。
OpenAI 发布一项分析,指出自 2012 年以来最大规模 AI 训练所用算力呈指数增长,翻倍周期为 3.4 个月,而摩尔定律的翻倍周期为 2 年。同一时期该指标增长超过 300,000 倍,若按 2 年翻倍则仅增长 7 倍。OpenAI 表示算力提升是 AI 进展的关键组成部分,若这一趋势延续,值得为远超当前能力的系统做准备。
推荐理由:OpenAI 用一组量化数据说明最大规模 AI 训练算力的增长节奏,可与摩尔定律对照理解算力趋势。
OpenAI 与 Future of Humanity Institute、Centre for the Study of Existential Risk、Center for a New American Security。
推荐理由:OpenAI 联合多家机构用近一年时间梳理 AI 被恶意利用的可能路径与防范思路,可作为 AI 安全治理早期讨论的参照。
OpenAI 发现自对弈能让模拟 AI 自行学会擒抱、闪避、假动作、踢球、接球和扑球等身体技能,无需在设计环境时预先设定这些技能。自对弈还能让环境难度始终与 AI 水平匹配,便于持续提升。结合此前的 Dota 2 自对弈结果,OpenAI 表示越来越确信自对弈将成为未来强大 AI 系统的核心部分。
推荐理由:OpenAI 用自对弈让模拟 AI 自行涌现出擒抱、假动作等身体技能,可与 Dota 2 结果对照理解自对弈的训练价值。
OpenAI 发布 Dota 2 研究补充说明,指出在算力充足时自对弈能把机器学习系统从远低于人类水平提升到超人水平。该系统在一个月内从勉强匹敌高排名玩家进步到击败顶尖职业选手,此后仍在持续提升。OpenAI 还指出,监督式深度学习系统的上限受训练数据集限制,而自对弈系统的可用数据会随智能体变强自动改善。
推荐理由:OpenAI 用 Dota 2 结果说明自对弈在算力充足时能把系统从远低于人类提升到超人水平。
OpenAI 宣布其打造的 bot 在标准锦标赛规则下的 Dota 2 1v1 对战中击败了世界顶级职业选手。该 bot 完全通过自我对弈从零学习游戏,未使用模仿学习或树搜索。OpenAI 称这是迈向在涉及真实人类的混乱复杂情境中完成明确目标的一步。
推荐理由:OpenAI 用自我对弈从零训练出的 bot 在标准赛制下击败 Dota 2 顶级选手,可看复杂实时环境中的方法取舍。
OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),其表现与当时最先进方法相当或更好,同时实现和调参都简单得多。PPO 因易用且性能良好,已成为 OpenAI 默认的强化学习算法。
推荐理由:OpenAI 公开 PPO 算法并说明其相比当时 SOTA 更易实现和调参,可了解该方法的提出背景。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类指出两种候选行为中哪一个更好,来推断人类想要的目标。OpenAI 称,构建安全 AI 系统的一步是免去人类手写目标函数,因为用简单代理替代复杂目标或把复杂目标写偏一点,都可能导致不良甚至危险的行为。
推荐理由:OpenAI 与 DeepMind 安全团队提出用人类偏好比较替代手写目标函数,为对齐研究提供了一条早期思路。
OpenAI 发布一套机器人系统,完全在仿真环境中训练后部署到实体机器人上,能在看过一次任务示范后学会新任务。
推荐理由:OpenAI 早期机器人研究,展示纯仿真训练后迁移到实体机器人并实现单次示范学习新任务。