OmniCVR: A Benchmark for Omni-Composed Video Retrieval with Vision, Audio, and Text
Composed video retrieval presents a complex challenge: retrieving a target video based on a source video and a textual modification instruction. This task demands fine-grained reasoning over multimodal transformations. However, existing benchmarks predominantly focus on vision–text alignment, largel…