2026
Scaling Laws for Conditional Emergence of Multilingual Image Captioning via Generalization from Translation
AAAI 2026technical
Cross-lingual, cross-task transfer is challenged by task-specific data scarcity, which becomes more severe as language support grows and is further amplified in vision-language models (VLMs). We investigate multilingual generalization in encoder-decoder transformer VLMs to enable zero-shot image cap