Gram2Token: Enabling Run-time GPU-Native Grammar-Constrained Decoding for LLMs
Grammar-constrained decoding is essential for enabling large language models (LLMs) to efficiently generate structured outputs in applications, such as JSON objects for parameter passing. Existing approaches typically execute grammar constraint masking on the CPU, while LLM inference is performed on…