跳到正文
OpenAI News·· 2017-07-20精选AI 评分62

OpenAI 发布强化学习算法 PPO

Proximal Policy Optimization

AI 导读

OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),其表现与当时最先进方法相当或更好,同时实现和调参都简单得多。PPO 因易用且性能良好,已成为 OpenAI 默认的强化学习算法。

推荐理由

OpenAI 公开 PPO 算法并说明其相比当时 SOTA 更易实现和调参,可了解该方法的提出背景。

来源:OpenAI News · openai.com