2021
Joint Multimedia Event Extraction from Video and Article
EMNLP 2021finding
Visual and textual modalities contribute complementary information about events described in multimedia documents. Videos contain rich dynamics and detailed unfoldings of events, while text describes more high-level and abstract concepts. However, existing event extraction methods either do not hand…