2023
RL4F: Generating Natural Language Feedback with Reinforcement Learning for Repairing Model Outputs
ACL 2023long
Despite their unprecedented success, even the largest language models make mistakes. Similar to how humans learn and improve using feedback, previous work proposed providing language models with natural language feedback to guide them in repairing their outputs. Because human-generated critiques are…