[arXiv]score: 0.18
SocialRL: Refining LLMs' Social Intelligence through Multi-turn Reinforcement Learning and Reward Design
September 10, 2026
SocialRL implements multi-turn PPO to propagate delayed outcome rewards across long-horizon dialogues, addressing the limitations of single-turn optimization. The framework utilizes six process reward dimensions, such as relational attunement and goal advancement, with a reward model that dynamically generates scoring criteria to manage goal-relationship trade-offs.
DAILY DIGEST
you don't check 9 sources — we do. one email every morning, read in 2 min. free. unsubscribe anytime. privacy