← Search

César Rodríguez

1 accepted papers

2025

Cross-lingual Transfer of Reward Models in Multilingual Alignment

NAACL 2025short

Reinforcement learning with human feedback (RLHF) is shown to largely benefit from precise reward models (RMs). However, recent studies in reward modeling schemes are skewed towards English, limiting the applicability of RLHF in multilingual alignments. In this work, we investigate the cross-lingual…