Hugging Face Blog·· 2022-08-05AI 评分13
Proximal Policy Optimization (PPO)
Proximal Policy Optimization (PPO)
AI 导读
Proximal Policy Optimization (PPO) 通过限制策略更新幅度来提升训练稳定性,避免过大更新导致模型崩溃。该方法使用当前与旧策略的概率比率,并将其裁剪在 [1−ϵ,1+ϵ] 范围内,从而约束策略变化。文章随后使用 PyTorch 从零实现 PPO 架构,并在 CartPole-v1 和 LunarLander-v2 环境中进行验证。
来源:Hugging Face Blog · huggingface.co