跳到正文
Hugging Face Blog·· 2022-08-05AI 评分22

Hugging Face 深度强化学习课程:PPO(近端策略优化)详解与 PyTorch 实现

Proximal Policy Optimization (PPO)

AI 导读

Hugging Face 深度强化学习课程第 8 单元讲解 Proximal Policy Optimization(PPO),通过裁剪当前与旧策略的概率比至 [1−ϵ,1+ϵ] 区间来限制策略更新幅度,避免训练不稳定。

来源:Hugging Face Blog · huggingface.co