OpenAI 发布 Dota 2 大规模深度强化学习研究
OpenAI 发布关于 Dota 2 大规模深度强化学习的研究,原文链接为 https://openai.com/index/dota-2-with-large-scale-deep-reinforcement-learning。
OpenAI 发布关于 Dota 2 大规模深度强化学习的研究,原文链接为 https://openai.com/index/dota-2-with-large-scale-deep-reinforcement-learning。
OpenAI 在模拟捉迷藏环境中训练智能体,观察到它们逐步学会使用更复杂的工具,并形成六种不同的策略与反策略,其中一些策略是该环境原本未被设计支持的。OpenAI 认为,这种在简单环境中自监督涌现出的复杂性,说明多智能体共同适应未来可能产生更复杂、更智能的行为。
推荐理由:OpenAI 在捉迷藏模拟环境中观察到智能体自发形成六种策略与反策略,可了解多智能体协同演化的一种研究路径。
OpenAI Five 在周末的 Finals 上连续两局击败 Dota 2 世界冠军战队 OG,成为首个战胜电竞世界冠军的 AI。此前 OpenAI Five 与 DeepMind 的 AlphaStar 都曾在私下击败高水平职业选手,但在直播的职业比赛中落败,因此这也是 AI 首次在直播中战胜电竞职业选手。
推荐理由:OpenAI Five 在直播中连胜 Dota 2 世界冠军 OG,可对照 AlphaStar 此前直播落败的节点理解 AI 竞技进展。
OpenAI 发布 Neural MMO,一个面向强化学习智能体的大规模多智能体游戏环境,支持在持久、开放式任务中容纳数量可变的大量智能体。该平台通过引入众多智能体与物种,带来更好的探索、差异化的生态位形成以及整体能力的提升。
OpenAI Five 本周在温哥华 The International 上对阵顶尖 Dota 2 选手,两局均告负,但在两局的前 20 至 35 分钟内都保持了较高的取胜机会。
OpenAI 宣布其由五个神经网络组成的团队 OpenAI Five 已在 Dota 2 中开始战胜业余人类队伍。该团队由五个神经网络构成,此次公布的是这一阶段性对战结果。
推荐理由:OpenAI 公开了由五个神经网络组成的 OpenAI Five 在 Dota 2 中开始战胜业余人类队伍这一阶段性结果。
OpenAI 开发出一种分层强化学习算法,能学习有助于解决一系列任务的高层动作,从而快速求解需要数千个时间步的任务。在导航问题集上,该算法发现了向不同方向行走和爬行的高层动作,使智能体能够快速掌握新的导航任务。
OpenAI 发现自对弈能让模拟 AI 自行学会擒抱、闪避、假动作、踢球、接球和扑球等身体技能,无需在设计环境时预先设定这些技能。自对弈还能让环境难度始终与 AI 水平匹配,便于持续提升。结合此前的 Dota 2 自对弈结果,OpenAI 表示越来越确信自对弈将成为未来强大 AI 系统的核心部分。
推荐理由:OpenAI 用自对弈让模拟 AI 自行涌现出擒抱、假动作等身体技能,可与 Dota 2 结果对照理解自对弈的训练价值。
OpenAI 发布 Learning with Opponent-Learning Awareness(LOLA)算法,该算法在建模时考虑其他智能体也在学习,从而在迭代囚徒困境中发现“tit-for-tat”这类既自利又合作的策略。这是迈向能够建模他人心智的智能体的一小步。
OpenAI 发布 Dota 2 研究补充说明,指出在算力充足时自对弈能把机器学习系统从远低于人类水平提升到超人水平。该系统在一个月内从勉强匹敌高排名玩家进步到击败顶尖职业选手,此后仍在持续提升。OpenAI 还指出,监督式深度学习系统的上限受训练数据集限制,而自对弈系统的可用数据会随智能体变强自动改善。
推荐理由:OpenAI 用 Dota 2 结果说明自对弈在算力充足时能把系统从远低于人类提升到超人水平。
OpenAI 宣布其打造的 bot 在标准锦标赛规则下的 Dota 2 1v1 对战中击败了世界顶级职业选手。该 bot 完全通过自我对弈从零学习游戏,未使用模仿学习或树搜索。OpenAI 称这是迈向在涉及真实人类的混乱复杂情境中完成明确目标的一步。
推荐理由:OpenAI 用自我对弈从零训练出的 bot 在标准赛制下击败 Dota 2 顶级选手,可看复杂实时环境中的方法取舍。
OpenAI 发布一项新研究,介绍智能体在训练中发展出自己语言的过程。该帖为摘要,未给出具体方法、实验设置或结果数据。
OpenAI 发布 Universe,一个用于衡量和训练 AI 通用智能的软件平台,覆盖全球的游戏、网站及其他应用。
推荐理由:OpenAI 发布 Universe 平台,读者可了解其用游戏和网站训练通用智能的定位。