2026
MM-SeR: Multimodal Self-Refinement for Lightweight Image Captioning
CVPR 2026
Systems such as video chatbots and navigation robots often depend on streaming image captioning to interpret visual inputs. Existing approaches typically employ large multimodal language models (MLLMs) for this purpose, but their substantial computational cost hinders practical application.This limi