2026
RuCL: Stratified Rubric-Based Curriculum Learning for Multimodal Large Language Model Reasoning
ICML 2026poster
Reinforcement Learning with Verifiable Rewards (RLVR) has emerged as a prevailing paradigm for enhancing reasoning in Multimodal Large Language Models (MLLMs). However, relying solely on outcome supervision risks reward hacking, where models learn spurious reasoning patterns to satisfy final answer …