← Search

Qingyang Yan

1 accepted papers

2026

Start Small, Think Big: Curriculum-based Relative Policy Optimization for Visual Grounding

AAAI 2026technical

Chain-of-Thought (CoT) prompting has recently shown significant promise across various NLP and computer vision tasks by explicitly generating intermediate reasoning steps. However, we find that reinforcement learning (RL)-based fine-tuned CoT reasoning can paradoxically degrade performance in Visual

Cited by 0SourcePDFScholar