← Search

Doohyuk Jang

4 accepted papers

2026

Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards

ICML 2026poster

Reinforcement learning with verifiable rewards (RLVR) has emerged as an effective post-training paradigm for improving the reasoning capabilities of large language models. However, existing group-based RLVR methods often suffer from severe sample inefficiency. This inefficiency stems from reliance o…

Cited by 0SourceScholar
2025

LANTERN: Accelerating Visual Autoregressive Models with Relaxed Speculative Decoding

ICLR 2025poster

Auto-Regressive (AR) models have recently gained prominence in image generation, often matching or even surpassing the performance of diffusion models. However, one major limitation of AR models is their sequential nature, which processes tokens one at a time, slowing down generation compared to mod…

2024

PromptKD: Distilling Student-Friendly Knowledge for Generative Language Models via Prompt Tuning

EMNLP 2024finding

Recent advancements in large language models (LLMs) have raised concerns about inference costs, increasing the need for research into model compression. While knowledge distillation (KD) is a prominent method for this, research on KD for generative language models like LLMs is relatively sparse, and…