LLMs develop new social biases via adaptive exploration
September 8, 2026
Large language models acquire novel social biases when employing adaptive exploration strategies during training or fine-tuning. This process introduces unforeseen behavioral shifts that were not present in static datasets.
HOW THIS AFFECTS YOU
●
researcherYou must account for dynamic bias emergence during iterative model training.
●
policyThis complicates safety auditing as models may develop new biases after initial evaluation.