policy_gradient¶
a2c_learner¶
Advantage Actor-Critic (A2C) Implementation: MindSpore
ddpg_learner¶
Deep Deterministic Policy Gradient (DDPG) Paper link: https://arxiv.org/pdf/1509.02971.pdf Implementation: MindSpore
mpdqn_learner¶
Multi-pass parameterised deep Q network (MP-DQN) Paper link: https://arxiv.org/pdf/1905.04388.pdf Implementation: MindSpore
- class xuance.mindspore.learners.policy_gradient.mpdqn_learner.MPDQN_Learner(config: Namespace, policy: mindspore.nn.Cell, callback)[source]¶
Bases:
Learner
npg_learner¶
pdqn_learner¶
Parameterised deep Q network (P-DQN) Paper link: https://arxiv.org/pdf/1810.06394.pdf Implementation: MindSpore
pg_learner¶
Policy Gradient (PG) Paper link: https://proceedings.neurips.cc/paper/2001/file/4b86abe48d358ecf194c56c69108433e-Paper.pdf Implementation: MindSpore
ppg_learner¶
Phasic Policy Gradient (PPG) Paper link: http://proceedings.mlr.press/v139/cobbe21a/cobbe21a.pdf Implementation: MindSpore
ppo_learner¶
Proximal Policy Optimization (PPO) with clip trick Paper link: https://arxiv.org/pdf/1707.06347.pdf Implementation: MindSpore
ppokl_learner¶
Proximal Policy Optimization with KL divergence (PPO-KL) Paper link: https://arxiv.org/pdf/1707.06347.pdf Implementation: MindSpore
sac_learner¶
Soft Actor-Critic with continuous action spaces (SAC) Paper link: http://proceedings.mlr.press/v80/haarnoja18b/haarnoja18b.pdf Implementation: MindSpore
sacdis_learner¶
Soft Actor-Critic with discrete action spaces (SAC-Discrete) Paper link: https://arxiv.org/pdf/1910.07207.pdf Implementation: MindSpore
spdqn_learner¶
Split parameterised deep Q network (SP-DQN) Paper link: https://arxiv.org/pdf/1810.06394.pdf Implementation: MindSpore
- class xuance.mindspore.learners.policy_gradient.spdqn_learner.SPDQN_Learner(config: Namespace, policy: mindspore.nn.Cell, callback)[source]¶
Bases:
Learner
td3_learner¶
Twin Delayed Deep Deterministic Policy Gradient (TD3) Paper link: http://proceedings.mlr.press/v80/fujimoto18a/fujimoto18a.pdf Implementation: MindSpore