2024
SpaceByte: Towards Deleting Tokenization from Large Language Modeling
NeurIPS 2024poster
Tokenization is widely used in large language models because it significantly improves performance. However, tokenization imposes several disadvantages, such as performance biases, increased adversarial vulnerability, decreased character-level modeling performance, and increased modeling complexity.…