From 2D Grids to 1D Tokens: Reforming Shared Representations for Multimodal Image Fusion
Multimodal image fusion (MMIF) aims to integrate complementary information from different modalities into a single fused image that preserves *fine local details* while maintaining *globally consistent appearance*. Most existing approaches build shared representations on 2D feature grids, which exce…