2024
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
CVPR 2024poster
Understanding and reasoning about spatial relationships is crucial for Visual Question Answering (VQA) and robotics. Vision Language Models (VLMs) have shown impressive performance in some VQA benchmarks but struggle with 3D spatial reasoning such as recognizing distances or size differences between…