PRISM Framework for Multi-Reward RL via Policy Decomposition
August 3, 2026
PRISM addresses the alignment tax in multi-reward reinforcement learning by optimizing standalone positive policies and a global negative policy instead of mixing reward functions. This decomposition reduces objective conflict and enables flexible policy composition during inference.
HOW THIS AFFECTS YOU
●
researcherYou can mitigate optimization instability in multi-objective RL by decomposing the problem into separate policy spaces.