2025
FractalLLM: Lossless Self-Speculative Decoding with Layer Embedded Self-Compression
EMNLP 2025
Autoregressive decoding in large language models (LLMs) necessitates a full forward pass for each generated token, significantly increasing inference latency. To address this limitation, we propose Fractal-LLM, a lossless self-speculative decoding method that embeds a compressed model within selecte