multi_agent_rl¶
coma_learner¶
COMA: Counterfactual Multi-Agent Policy Gradients Paper link: https://ojs.aaai.org/index.php/AAAI/article/view/11794 Implementation: TensorFlow 2.X
- class xuance.tensorflow.learners.multi_agent_rl.coma_learner.COMA_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: tensorflow.keras.Model, callback)[source]¶
Bases:
IAC_Learner
commnet_learner¶
dcg_learner¶
DCG: Deep coordination graphs Paper link: http://proceedings.mlr.press/v119/boehmer20a/boehmer20a.pdf Implementation: TensorFlow 2.X
- class xuance.tensorflow.learners.multi_agent_rl.dcg_learner.DCG_Learner(config: Namespace, policy: tensorflow.keras.Model, optimizer: tensorflow.keras.optimizers.Optimizer, device: str = 'cpu:0', model_dir: str = './', gamma: float = 0.99, sync_frequency: int = 100)[source]¶
Bases:
LearnerMAS
iac_learner¶
Independent Advantage Actor Critic (IAC) Paper link: https://ojs.aaai.org/index.php/AAAI/article/view/11794 Implementation: TensorFlow2
- class xuance.tensorflow.learners.multi_agent_rl.iac_learner.IAC_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: tensorflow.keras.Model, callback)[source]¶
Bases:
LearnerMAS- build_training_data(sample: dict | None, use_parameter_sharing: bool | None = False, use_actions_mask: bool | None = False, use_global_state: bool | None = False)[source]¶
Prepare the training data.
- Parameters:
sample (dict) – The raw sampled data.
use_parameter_sharing (bool) – Whether to use parameter sharing for individual agent models.
use_actions_mask (bool) – Whether to use actions mask for unavailable actions.
use_global_state (bool) – Whether to use global state.
- Returns:
The formatted sampled data.
- Return type:
sample_Tensor (dict)
ic3net_learner¶
- class xuance.tensorflow.learners.multi_agent_rl.ic3net_learner.IC3Net_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: torch.nn.Module, callback)[source]¶
Bases:
CommNet_Learner- build_training_data(sample: dict | None, use_parameter_sharing: bool | None = False, use_actions_mask: bool | None = False, use_global_state: bool | None = False)[source]¶
Prepare the training data.
- Parameters:
sample (dict) – The raw sampled data.
use_parameter_sharing (bool) – Whether to use parameter sharing for individual agent models.
use_actions_mask (bool) – Whether to use actions mask for unavailable actions.
use_global_state (bool) – Whether to use global state.
- Returns:
The formatted sampled data.
- Return type:
sample_Tensor (dict)
iddpg_learner¶
Independent Deep Deterministic Policy Gradient (IDDPG) Implementation: TensorFlow 2.X
- class xuance.tensorflow.learners.multi_agent_rl.iddpg_learner.IDDPG_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: tensorflow.keras.Model, callback)[source]¶
Bases:
LearnerMAS- forward_fn(bs, obs, actions, rewards, obs_next, terminals, IDs, agent_mask)¶
- learn(*inputs)¶
ippo_learner¶
Independent Proximal Policy Optimization (IPPO) Paper link: https://arxiv.org/pdf/2103.01955.pdf Implementation: TensorFlow 2.X
iql_learner¶
Independent Q-learning (IQL) Implementation: TensorFlow 2.X
isac_learner¶
Independent Soft Actor-critic (ISAC) Implementation: TensorFlow 2.X
- class xuance.tensorflow.learners.multi_agent_rl.isac_learner.ISAC_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: tensorflow.keras.Model, callback)[source]¶
Bases:
LearnerMAS
isacdis_learner¶
Independent Soft Actor-critic (ISAC) with discrete action spaces. Implementation: Pytorch
- members:
- undoc-members:
- show-inheritance:
maddpg_learner¶
Multi-Agent Deep Deterministic Policy Gradient Paper link: https://proceedings.neurips.cc/paper/2017/file/68a9750337a418a86fe06c1991a1d64c-Paper.pdf Implementation: TensorFlow 2.X Trick: Parameter sharing for all agents, with agents’ one-hot IDs as actor-critic’s inputs.
- class xuance.tensorflow.learners.multi_agent_rl.maddpg_learner.MADDPG_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: tensorflow.keras.Model, callback)[source]¶
Bases:
LearnerMAS- forward_fn(batch_size, bs, obs, obs_joint, actions, actions_joint, rewards, obs_next, next_obs_joint, terminals, IDs, agent_mask)¶
- learn(*inputs)¶
mappo_learner¶
Multi-Agent Proximal Policy Optimization (MAPPO) Paper link: https://arxiv.org/pdf/2103.01955.pdf Implementation: TensorFlow 2.X
masac_learner¶
Multi-agent Soft Actor-critic (MASAC) Implementation: TensorFlow 2.X
masacdis_learner¶
Multi-agent Soft Actor-critic (MASAC) with discrete action spaces. Implementation: Pytorch
matd3_learner¶
Multi-Agent TD3
- class xuance.tensorflow.learners.multi_agent_rl.matd3_learner.MATD3_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: tensorflow.keras.Model, callback)[source]¶
Bases:
LearnerMAS- forward_fn(batch_size, bs, obs, obs_joint, actions, actions_joint, rewards, obs_next, next_obs_joint, terminals, IDs, agent_mask)¶
- learn(*inputs)¶
mfac_learner¶
MFAC: Mean Field Actor-Critic Paper link: http://proceedings.mlr.press/v80/yang18d/yang18d.pdf Implementation: TensorFlow 2.X
- class xuance.tensorflow.learners.multi_agent_rl.mfac_learner.MFAC_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: tensorflow.keras.Model, callback)[source]¶
Bases:
IPPO_Learner
mfq_learner¶
MFQ: Mean Field Q-Learning Paper link: http://proceedings.mlr.press/v80/yang18d/yang18d.pdf Implementation: TensorFlow 2.X
- class xuance.tensorflow.learners.multi_agent_rl.mfq_learner.MFQ_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: tensorflow.keras.Model, callback)[source]¶
Bases:
LearnerMAS- forward_fn(*args)¶
- learn(*inputs)¶
qmix_learner¶
Qmix: Monotonic value function factorisation for deep multi-agent reinforcement learning Paper link: http://proceedings.mlr.press/v80/rashid18a/rashid18a.pdf Implementation: TensorFlow 2.X
- class xuance.tensorflow.learners.multi_agent_rl.qmix_learner.QMIX_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: tensorflow.keras.Model, callback)[source]¶
Bases:
LearnerMAS- forward_fn(bs, state, obs, actions, rewards_tot, state_next, obs_next, terminals_tot, agent_mask, avail_actions, avail_actions_next, IDs)¶
- learn(*inputs)¶
qtran_learner¶
QTRAN: Learning to Factorize with Transformation for Cooperative Multi-Agent Reinforcement Learning Paper link: http://proceedings.mlr.press/v97/son19a/son19a.pdf Implementation: TensorFlow 2.X
- class xuance.tensorflow.learners.multi_agent_rl.qtran_learner.QTRAN_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: tensorflow.keras.Model, callback)[source]¶
Bases:
LearnerMAS
tarmac_learner¶
- class xuance.tensorflow.learners.multi_agent_rl.tarmac_learner.TarMAC_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: torch.nn.Module, callback)[source]¶
Bases:
IC3Net_Learner
vdac_learner¶
Value Decomposition Actor-Critic (VDAC) Paper link: https://ojs.aaai.org/index.php/AAAI/article/view/17353 Implementation: TensorFlow2
vdn_learner¶
Value Decomposition Networks (VDN) Paper link: https://arxiv.org/pdf/1706.05296.pdf Implementation: TensorFlow 2.X
- class xuance.tensorflow.learners.multi_agent_rl.vdn_learner.VDN_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: tensorflow.keras.Model, callback)[source]¶
Bases:
LearnerMAS- forward_fn(bs, obs, actions, rewards_tot, obs_next, terminals_tot, agent_mask, avail_actions, avail_actions_next, IDs)¶
- learn(*inputs)¶
wqmix_learner¶
Weighted QMIX Paper link: https://proceedings.neurips.cc/paper/2020/file/73a427badebe0e32caa2e1fc7530b7f3-Paper.pdf Implementation: TensorFlow 2.X
- class xuance.tensorflow.learners.multi_agent_rl.wqmix_learner.WQMIX_Learner(config: Namespace, model_keys: List[str], agent_keys: List[str], policy: tensorflow.keras.Model, callback)[source]¶
Bases:
LearnerMAS- forward_fn(bs, batch_size, state, obs, actions, rewards_tot, state_next, obs_next, terminals_tot, agent_mask, avail_actions, avail_actions_next, IDs)¶
- learn(*inputs)¶