OpenAI 的 Dota 2 bot 在 1v1 标准赛制下击败顶级职业选手
OpenAI 宣布其打造的 bot 在标准锦标赛规则下的 Dota 2 1v1 对战中击败了世界顶级职业选手。该 bot 完全通过自我对弈从零学习游戏,未使用模仿学习或树搜索。OpenAI 称这是迈向在涉及真实人类的混乱复杂情境中完成明确目标的一步。
推荐理由:OpenAI 用自我对弈从零训练出的 bot 在标准赛制下击败 Dota 2 顶级选手,可看复杂实时环境中的方法取舍。
OpenAI 宣布其打造的 bot 在标准锦标赛规则下的 Dota 2 1v1 对战中击败了世界顶级职业选手。该 bot 完全通过自我对弈从零学习游戏,未使用模仿学习或树搜索。OpenAI 称这是迈向在涉及真实人类的混乱复杂情境中完成明确目标的一步。
推荐理由:OpenAI 用自我对弈从零训练出的 bot 在标准赛制下击败 Dota 2 顶级选手,可看复杂实时环境中的方法取舍。
OpenAI 发现,向强化学习算法的参数中加入自适应噪声,往往能提升性能。这种探索方法实现简单,且极少导致性能下降,因此值得在任何问题上尝试。
OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),其表现与当时最先进方法相当或更好,同时实现和调参都简单得多。PPO 因易用且性能良好,已成为 OpenAI 默认的强化学习算法。
推荐理由:OpenAI 公开 PPO 算法并说明其相比当时 SOTA 更易实现和调参,可了解该方法的提出背景。
OpenAI 造出能从不同尺度和视角稳定欺骗神经网络分类器的对抗图像,直接挑战了上周"自动驾驶汽车因多尺度、多角度取像而难以被恶意欺骗"的说法。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类指出两种候选行为中哪一个更好,来推断人类想要的目标。OpenAI 称,构建安全 AI 系统的一步是免去人类手写目标函数,因为用简单代理替代复杂目标或把复杂目标写偏一点,都可能导致不良甚至危险的行为。
推荐理由:OpenAI 与 DeepMind 安全团队提出用人类偏好比较替代手写目标函数,为对齐研究提供了一条早期思路。
OpenAI 发布一套机器人系统,完全在仿真环境中训练后部署到实体机器人上,能在看过一次任务示范后学会新任务。
推荐理由:OpenAI 早期机器人研究,展示纯仿真训练后迁移到实体机器人并实现单次示范学习新任务。
OpenAI 开发了一个无监督系统,仅通过预测 Amazon 评论文本中的下一个字符进行训练,却学到了对情感的良好表征。
OpenAI 发现,已有数十年历史的进化策略(ES)在现代强化学习基准(如 Atari/MuJoCo)上性能可与标准强化学习(RL)技术相媲美,同时规避了 RL 的诸多不便。
OpenAI 发布一项新研究,介绍智能体在训练中发展出自己语言的过程。该帖为摘要,未给出具体方法、实验设置或结果数据。
OpenAI 与 Berkeley、Stanford 研究人员共同合著了由 Google Brain 主导的论文《Concrete Problems in AI Safety》,该论文探讨了确保现代机器学习系统按预期运行的诸多研究问题。