UNeMo: Collaborative Visual-Language Reasoning and Navigation via a Multimodal World Model
Vision-and-Language Navigation (VLN) requires agents to autonomously navigate complex environments via visual images and natural language instructions—remains highly challenging. Recent research on enhancing language-guided navigation reasoning using pre-trained large language models (LLMs) has show