← Search

Ifdita Hasan Orney

1 accepted papers

2026

Polychromic Objectives for Reinforcement Learning

ICLR 2026poster

Reinforcement learning fine-tuning (RLFT) is a dominant paradigm for improving pretrained policies for downstream tasks. These pretrained policies, trained on large datasets, produce generations with a broad range of promising but unrefined behaviors. Often, a critical failure mode of RLFT arises wh…

Cited by 0SourceScholar