跳到正文
原文
Hugging Face Blog·· 2022-06-30AI 评分12

使用 PyTorch 实现策略梯度算法

Policy Gradient with PyTorch

AI 导读

Hugging Face 发布 Deep Reinforcement Learning Class 第 5 单元,介绍并从头使用 PyTorch 实现 Reinforce 算法。该策略梯度方法直接优化策略权重,无需学习值函数,能学习随机策略并处理高维及连续动作空间。文章随后将在 CartPole-v1、PixelCopter 和 Pong 环境中测试其鲁棒性。

来源:Hugging Face Blog · huggingface.co