跳到正文
Hugging Face Blog·· 2022-05-20AI 评分22

Hugging Face 深度强化学习课程:Q-Learning 入门(下)

An Introduction to Q-Learning Part 2/2

AI 导读

Hugging Face 深度强化学习课程第二单元第二部分讲解 Q-Learning 算法,并从头实现首个 RL 智能体。该算法属于 off-policy 的基于价值方法,采用 TD 方式训练动作价值函数,内部维护一张 Q-table 存储每个状态-动作对的价值。智能体将在 Frozen Lake v1 和自动驾驶出租车两个环境中训练,为第三单元的 Deep Q-Learning 打基础。

来源:Hugging Face Blog · huggingface.co