2022
The Surprising Effectiveness of PPO in Cooperative Multi-Agent Games
Proximal Policy Optimization (PPO) is a ubiquitous on-policy reinforcement learn- ing algorithm but is significantly less utilized than off-policy learning algorithms in multi-agent settings. This is often due to the belief that PPO is significantly less sample efficient than off...