2022
MOMA-LRG: Language-Refined Graphs for Multi-Object Multi-Actor Activity Parsing
NeurIPS 2022accept
Video-language models (VLMs), large models pre-trained on numerous but noisy video-text pairs from the internet, have revolutionized activity recognition through their remarkable generalization and open-vocabulary capabilities. While complex human activities are often hierarchical and compositional,…