OpenAI News·· 2018-10-31AI 评分32
OpenAI 提出基于预测奖励的强化学习新方法 RND
Reinforcement learning with prediction-based rewards
AI 导读
OpenAI 开发了 Random Network Distillation(RND),一种基于预测的奖励方法,通过好奇心鼓励强化学习智能体探索环境,首次在《蒙特祖玛的复仇》上超越人类平均表现。
来源:OpenAI News · openai.com
Reinforcement learning with prediction-based rewards
OpenAI 开发了 Random Network Distillation(RND),一种基于预测的奖励方法,通过好奇心鼓励强化学习智能体探索环境,首次在《蒙特祖玛的复仇》上超越人类平均表现。
来源:OpenAI News · openai.com