2025
Counterfactual Reasoning for Steerable Pluralistic Value Alignment of Large Language Models
NeurIPS 2025poster
As large language models (LLMs) become increasingly integrated into applications serving users across diverse cultures, communities, and demographics, it is critical to align LLMs with pluralistic human values beyond average principles (e.g., HHH). In psychological and social value theories such as…