跳到正文
7月20日周四
  1. OpenAI News62

    OpenAI 发布强化学习算法 PPO

    OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),其表现与当时最先进方法相当或更好,同时实现和调参都简单得多。PPO 因易用且性能良好,已成为 OpenAI 默认的强化学习算法。

    推荐理由:OpenAI 公开 PPO 算法并说明其相比当时 SOTA 更易实现和调参,可了解该方法的提出背景。

6月28日周三
5月24日周三
  1. OpenAI News62

    OpenAI 开源强化学习复现项目 Baselines,首批发布 DQN 及三个变体

    OpenAI 开源内部项目 OpenAI Baselines,目标是以与已发表结果相当的性能复现强化学习算法。首批发布包含 DQN 及其三个变体,其余算法将在接下来几个月内陆续放出。

    推荐理由:OpenAI 开源内部强化学习复现项目 Baselines,首批放出 DQN 及三个变体,可了解其复现思路与后续发布节奏。

5月15日周一
4月27日周三
  1. OpenAI News62

    OpenAI 发布强化学习工具包 Gym 公测版

    OpenAI 发布强化学习工具包 OpenAI Gym 的公测版,用于开发和比较 RL 算法。它包含一套持续扩充的环境,涵盖模拟机器人和 Atari 游戏,并提供一个用于比较和复现结果的站点。

    推荐理由:OpenAI 公开强化学习工具包 Gym 的 beta 版,可了解其环境套件与结果对比站点的定位。