Learn What’s Left, Not What’s Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization
Researchers introduced Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization (SA-MRPO), a method for multi-objective reinforcement learning that normalizes each…