Adding mutual-action-predictability (TeamReg) or synchronized sub-policy switching (CoachReg) as a training-time objective improves cooperative multi-agent RL performance over MADDPG baselines on several sparse-reward tasks.
Bayesian action decoder for deep multi-agent reinforcement learning
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.LG 1years
2019 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Promoting Coordination through Policy Regularization in Multi-Agent Deep Reinforcement Learning
Adding mutual-action-predictability (TeamReg) or synchronized sub-policy switching (CoachReg) as a training-time objective improves cooperative multi-agent RL performance over MADDPG baselines on several sparse-reward tasks.