OpenAI 发布 Spinning Up in Deep RL 深度强化学习教育资源
OpenAI 发布深度强化学习教育资源 Spinning Up in Deep RL,旨在让任何人都能学习成为深度强化学习的熟练实践者。该资源包含清晰的 RL 代码示例、教学练习、文档和教程。
OpenAI 发布深度强化学习教育资源 Spinning Up in Deep RL,旨在让任何人都能学习成为深度强化学习的熟练实践者。该资源包含清晰的 RL 代码示例、教学练习、文档和教程。
OpenAI 推出可逆生成模型 Glow,采用可逆 1x1 卷积,简化了此前可逆生成模型的架构。该模型能生成逼真的高分辨率图像,支持高效采样,并可发现用于操控数据属性的特征。OpenAI 同步开源模型代码并上线在线可视化工具。
OpenAI 发布强化学习游戏研究平台 Gym Retro 的完整版,公开游戏数量从约 70 款 Atari 游戏和 30 款 Sega 游戏扩展到覆盖多种模拟器的 1000 多款游戏。同时发布的还有用于向该平台添加新游戏的工具。
OpenAI 发布八个模拟机器人环境和 Hindsight Experience Replay 的 Baselines 实现,均基于过去一年的研究开发,并已用于训练可运行在实体机器人上的模型。OpenAI 同时发布了一系列机器人研究课题请求。
OpenAI 发布针对块稀疏权重神经网络的高度优化 GPU kernel,按所选稀疏度可比 cuBLAS 或 cuSPARSE 快数个数量级。该 kernel 已被用于文本情感分析和文本、图像生成建模,并取得当时的最优结果。
OpenAI Baselines 发布 ACKTR 和 A2C 两个新实现。A2C 是 A3C 的同步确定性变体,性能与之相当;ACKTR 比 TRPO 和 A2C 更具样本效率,每次更新仅需略多于 A2C 的计算量。
OpenAI 开源了 RL-Teacher,一种通过偶发人类反馈而非手工设计奖励函数来训练 AI 的接口实现。该技术旨在推进安全 AI 系统,也适用于奖励难以明确指定的强化学习问题。
OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),其表现与当时最先进方法相当或更好,同时实现和调参都简单得多。PPO 因易用且性能良好,已成为 OpenAI 默认的强化学习算法。
推荐理由:OpenAI 公开 PPO 算法并说明其相比当时 SOTA 更易实现和调参,可了解该方法的提出背景。
OpenAI 开源了一个基于 MuJoCo 引擎的高性能 Python 机器人仿真库,该库源自其过去一年的机器人研究。
OpenAI 开源内部项目 OpenAI Baselines,目标是以与已发表结果相当的性能复现强化学习算法。首批发布包含 DQN 及其三个变体,其余算法将在接下来几个月内陆续放出。
推荐理由:OpenAI 开源内部强化学习复现项目 Baselines,首批放出 DQN 及三个变体,可了解其复现思路与后续发布节奏。
OpenAI 发布 Roboschool,这是一款用于机器人仿真的开源软件,并已与 OpenAI Gym 集成。
推荐理由:OpenAI 开源机器人仿真软件并接入 Gym,读者可了解其与既有强化学习环境的衔接方式。
OpenAI 发布强化学习工具包 OpenAI Gym 的公测版,用于开发和比较 RL 算法。它包含一套持续扩充的环境,涵盖模拟机器人和 Atari 游戏,并提供一个用于比较和复现结果的站点。
推荐理由:OpenAI 公开强化学习工具包 Gym 的 beta 版,可了解其环境套件与结果对比站点的定位。