2026
GraphVLM: Benchmarking Vision Language Models for Multimodal Graph Learning
CVPR 2026
Vision-Language Models (VLMs) have demonstrated remarkable capabilities in aligning and understanding multimodal signals, yet their potential to reason over structured data, where multimodal entities are connected through explicit relational graphs, remains largely underexplored. Unlocking this capa