CHUNK-WISE ATTENTION TRANSDUCERS FOR FAST AND ACCURATE STREAMING SPEECH-TO-TEXT
We propose Chunk-wise Attention Transducer (CHAT), a novel extension to RNN-T models that processes audio in fixed-size chunks while employing cross-attention within each chunk. This hybrid approach maintains RNN-T's streaming capability while introducing controlled flexibility for local alignment m…