← Search

Zhangyuan Yu

1 accepted papers

2026

CFPO : Counterfactual Policy Optimization For Multimodal Reasoning

ICML 2026poster

Large Vision-Language Models (LVLMs) have demonstrated remarkable capabilities in multimodal reasoning. However, prevailing reinforcement learning (RL) paradigms lack explicit counterfactual enhancement and causal learning mechanisms. This fundamental deficiency results in severe grounding failures,…

Cited by 0SourceScholar