2025
DiTFastAttnV2: Head-wise Attention Compression for Multi-Modality Diffusion Transformers
ICCV 2025poster
Text-to-image generation models, especially Multimodal Diffusion Transformers (MMDiT), have shown remarkable progress in generating high-quality images. However, these models often face significant computational bottlenecks, particularly in attention mechanisms, which hinder their scalability and ef…