← Search

Peijin Xie

3 accepted papers

2026

CR³: Boosting Compositional Reasoning in MLLMs Through Rule-Based Reinforcement Learning

AAAI 2026technical

Compositional reasoning is a critical capability for multimodal models, enabling systematic understanding of complex scenes through structured combinations of objects, attributes, and relations. However, existing research on this ability primarily focuses on vision-language models (VLMs, e.g., CLIP

Cited by 0SourcePDFScholar
2025

Expand VSR Benchmark for VLLM to Expertize in Spatial Rules

AAAI 2025technical

Distinguishing spatial relations is a basic part of human cognition which requires fine-grained perception on cross-instance. Although benchmarks like MME, MMBench and SEED comprehensively have evaluated various capabilities which already include visual spatial reasoning(VSR). There is still a la…