multi_agent_rl¶
coma_learner¶
COMA: Counterfactual Multi-Agent Policy Gradients Paper link: https://ojs.aaai.org/index.php/AAAI/article/view/11794 Implementation: MindSpore
- class xuance.mindspore.learners.multi_agent_rl.coma_learner.COMA_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: mindspore.nn.Cell, callback)[source]¶
Bases:
LearnerMAS- actor_forward_fn(bs, obs, actions, values_pred_dict, agent_mask, avail_actions, IDs, epsilon)[source]¶
- build_training_data(sample: dict | None, use_parameter_sharing: bool | None = False, use_actions_mask: bool | None = False, use_global_state: bool | None = False)[source]¶
Prepare the training data.
- Parameters:
sample (dict) – The raw sampled data.
use_parameter_sharing (bool) – Whether to use parameter sharing for individual agent models.
use_actions_mask (bool) – Whether to use actions mask for unavailable actions.
use_global_state (bool) – Whether to use global state.
- Returns:
The formatted sampled data.
- Return type:
sample_Tensor (dict)
commnet_learner¶
dcg_learner¶
DCG: Deep coordination graphs Paper link: http://proceedings.mlr.press/v119/boehmer20a/boehmer20a.pdf Implementation: MindSpore
- class xuance.mindspore.learners.multi_agent_rl.dcg_learner.DCG_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: mindspore.nn.Cell, callback)[source]¶
Bases:
LearnerMAS
iac_learner¶
Independent Advantage Actor Critic (IAC) Paper link: https://ojs.aaai.org/index.php/AAAI/article/view/11794 Implementation: Pytorch
- class xuance.mindspore.learners.multi_agent_rl.iac_learner.IAC_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: mindspore.nn.Cell, callback)[source]¶
Bases:
LearnerMAS- build_training_data(sample: dict | None, use_parameter_sharing: bool | None = False, use_actions_mask: bool | None = False, use_global_state: bool | None = False)[source]¶
Prepare the training data.
- Parameters:
sample (dict) – The raw sampled data.
use_parameter_sharing (bool) – Whether to use parameter sharing for individual agent models.
use_actions_mask (bool) – Whether to use actions mask for unavailable actions.
use_global_state (bool) – Whether to use global state.
- Returns:
The formatted sampled data.
- Return type:
sample_Tensor (dict)
ic3net_learner¶
- class xuance.mindspore.learners.multi_agent_rl.ic3net_learner.IC3Net_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: torch.nn.Module, callback)[source]¶
Bases:
CommNet_Learner- build_training_data(sample: dict | None, use_parameter_sharing: bool | None = False, use_actions_mask: bool | None = False, use_global_state: bool | None = False)[source]¶
Prepare the training data.
- Parameters:
sample (dict) – The raw sampled data.
use_parameter_sharing (bool) – Whether to use parameter sharing for individual agent models.
use_actions_mask (bool) – Whether to use actions mask for unavailable actions.
use_global_state (bool) – Whether to use global state.
- Returns:
The formatted sampled data.
- Return type:
sample_Tensor (dict)
iddpg_learner¶
Independent Deep Deterministic Policy Gradient (IDDPG) Implementation: MindSpore
- class xuance.mindspore.learners.multi_agent_rl.iddpg_learner.IDDPG_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: mindspore.nn.Cell, callback)[source]¶
Bases:
LearnerMAS
ippo_learner¶
Multi-Agent Proximal Policy Optimization (MAPPO) Paper link: https://arxiv.org/pdf/2103.01955.pdf Implementation: MindSpore
iql_learner¶
Independent Q-learning (IQL) Implementation: MindSpore
- class xuance.mindspore.learners.multi_agent_rl.iql_learner.IQL_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: mindspore.nn.Cell, callback)[source]¶
Bases:
LearnerMAS
isac_learner¶
Independent Soft Actor-critic (ISAC) Implementation: MindSpore
- class xuance.mindspore.learners.multi_agent_rl.isac_learner.ISAC_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: mindspore.nn.Cell, callback)[source]¶
Bases:
LearnerMAS
isacdis_learner¶
Independent Soft Actor-critic (ISAC) with discrete action spaces. Implementation: Pytorch
- members:
- undoc-members:
- show-inheritance:
maddpg_learner¶
Multi-Agent Deep Deterministic Policy Gradient Paper link: https://proceedings.neurips.cc/paper/2017/file/68a9750337a418a86fe06c1991a1d64c-Paper.pdf Implementation: MindSpore Trick: Parameter sharing for all agents, with agents’ one-hot IDs as actor-critic’s inputs.
- class xuance.mindspore.learners.multi_agent_rl.maddpg_learner.MADDPG_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: mindspore.nn.Cell, callback)[source]¶
Bases:
LearnerMAS
mappo_learner¶
Multi-Agent Proximal Policy Optimization (MAPPO) Paper link: https://arxiv.org/pdf/2103.01955.pdf Implementation: MindSpore
masac_learner¶
Multi-agent Soft Actor-critic (MASAC) Implementation: MindSpore
- class xuance.mindspore.learners.multi_agent_rl.masac_learner.MASAC_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: mindspore.nn.Cell, callback)[source]¶
Bases:
LearnerMAS
masacdis_learner¶
Multi-agent Soft Actor-critic (MASAC) with discrete action spaces. Implementation: Pytorch
matd3_learner¶
Multi-Agent TD3
- class xuance.mindspore.learners.multi_agent_rl.matd3_learner.MATD3_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: mindspore.nn.Cell, callback)[source]¶
Bases:
LearnerMAS
mfac_learner¶
MFAC: Mean Field Actor-Critic Paper link: http://proceedings.mlr.press/v80/yang18d/yang18d.pdf Implementation: Pytorch
- class xuance.mindspore.learners.multi_agent_rl.mfac_learner.MFAC_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: mindspore.nn.Cell, callback)[source]¶
Bases:
IPPO_Learner
mfq_learner¶
MFQ: Mean Field Q-Learning Paper link: http://proceedings.mlr.press/v80/yang18d/yang18d.pdf Implementation: MindSpore
- class xuance.mindspore.learners.multi_agent_rl.mfq_learner.MFQ_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: mindspore.nn.Cell, callback)[source]¶
Bases:
LearnerMAS
qmix_learner¶
Qmix: Monotonic value function factorisation for deep multi-agent reinforcement learning Paper link: http://proceedings.mlr.press/v80/rashid18a/rashid18a.pdf Implementation: MindSpore
- class xuance.mindspore.learners.multi_agent_rl.qmix_learner.QMIX_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: mindspore.nn.Cell, callback)[source]¶
Bases:
LearnerMAS
qtran_learner¶
QTRAN: Learning to Factorize with Transformation for Cooperative Multi-Agent Reinforcement Learning Paper link: http://proceedings.mlr.press/v97/son19a/son19a.pdf Implementation: MindSpore
- class xuance.mindspore.learners.multi_agent_rl.qtran_learner.QTRAN_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: mindspore.nn.Cell, callback)[source]¶
Bases:
LearnerMAS
tarmac_learner¶
- class xuance.mindspore.learners.multi_agent_rl.tarmac_learner.TarMAC_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: torch.nn.Module, callback)[source]¶
Bases:
IC3Net_Learner
vdac_learner¶
Value Decomposition Actor-Critic (VDAC) Paper link: https://ojs.aaai.org/index.php/AAAI/article/view/17353 Implementation: MindSpore
vdn_learner¶
Value Decomposition Networks (VDN) Paper link: https://arxiv.org/pdf/1706.05296.pdf Implementation: MindSpore
- class xuance.mindspore.learners.multi_agent_rl.vdn_learner.VDN_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: mindspore.nn.Cell, callback)[source]¶
Bases:
LearnerMAS
wqmix_learner¶
Weighted QMIX Paper link: https://proceedings.neurips.cc/paper/2020/file/73a427badebe0e32caa2e1fc7530b7f3-Paper.pdf Implementation: MindSpore
- class xuance.mindspore.learners.multi_agent_rl.wqmix_learner.WQMIX_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: mindspore.nn.Cell, callback)[source]¶
Bases:
LearnerMAS