← Search

Caleb Zheng

2 accepted papers

2025

SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing

NeurIPS 2025oral

3D spatial reasoning in dynamic, audio-visual environments is a cornerstone of human cognition yet remains largely unexplored by existing Audio-Visual Large Language Models (AV-LLMs) and benchmarks, which predominantly focus on static or 2D scenes. We introduce SAVVY-Bench, the first benchmark for 3…

Cited by 0SourceScholar