跳到正文
OpenAI News·· 2018-07-04精选AI 评分62

OpenAI 用单次演示让智能体在《蒙特祖玛的复仇》中取得 74500 分

Learning Montezuma’s Revenge from a single demonstration

AI 导读

OpenAI 训练出一个智能体,仅凭单次人类演示就在《蒙特祖玛的复仇》中取得 74500 分的高分,超过此前所有已公布结果。其算法从演示中挑选特定状态作为起点,让智能体依次游玩并优化游戏得分,所用强化学习算法 PPO 也是 OpenAI Five 的基础。

推荐理由

OpenAI 用单次人类演示加 PPO 在《蒙特祖玛的复仇》上取得 74500 分,可了解演示驱动强化学习的早期思路。

来源:OpenAI News · openai.com