OpenAI News·· 2016-12-21AI 评分32
OpenAI 谈强化学习中的奖励函数设定错误
Faulty reward functions in the wild
AI 导读
OpenAI 发文探讨强化学习算法的一种失效模式:奖励函数设定不当。文章指出,强化学习算法可能以出人意料、反直觉的方式崩溃,而奖励函数设定错误正是其中一种失败情形。
来源:OpenAI News · openai.com
Faulty reward functions in the wild
OpenAI 发文探讨强化学习算法的一种失效模式:奖励函数设定不当。文章指出,强化学习算法可能以出人意料、反直觉的方式崩溃,而奖励函数设定错误正是其中一种失败情形。
来源:OpenAI News · openai.com