跳到正文
OpenAI News·· 2016-12-21AI 评分32

OpenAI 谈强化学习中的奖励函数设定错误

Faulty reward functions in the wild

AI 导读

OpenAI 发文探讨强化学习算法的一种失效模式:奖励函数设定不当。文章指出,强化学习算法可能以出人意料、反直觉的方式崩溃,而奖励函数设定错误正是其中一种失败情形。

来源:OpenAI News · openai.com