2026
QFlash: Bridging Quantization and Memory Efficiency in Vision Transformer Attention
IJCAI 2026
FlashAttention improves efficiency through tiling, but its online softmax still relies on floating-point arithmetic for numerical stability, making full quantization difficult. We identify three main obstacles to integer-only FlashAttention: (1) scale explosion during tile-wise accumulation, (2) ine