2026
Start Small, Think Big: Curriculum-based Relative Policy Optimization for Visual Grounding
AAAI 2026technical
Chain-of-Thought (CoT) prompting has recently shown significant promise across various NLP and computer vision tasks by explicitly generating intermediate reasoning steps. However, we find that reinforcement learning (RL)-based fine-tuned CoT reasoning can paradoxically degrade performance in Visual