TLCR: Token-Level Continuous Reward for Fine-grained Reinforcement Learning from Human Feedback
Reinforcement Learning from Human Feedback (RLHF) leverages human preference data to train language models to align more closely with human essence. These human preference data, however, are labeled at the sequence level, creating a mismatch between sequence-level preference labels and tokens, which…