← Search

Yurun Yuan

2 accepted papers

2025

Trajectory Bellman Residual Minimization: A Simple Value-Based Method for LLM Reasoning

NeurIPS 2025poster

Policy-based methods currently dominate reinforcement learning (RL) pipelines for large language model (LLM) reasoning, leaving value-based approaches largely unexplored. We revisit the classical paradigm of Bellman Residual Minimization and introduce Trajectory Bellman Residual Minimization (TBRM),…

Cited by 0SourcecodeScholar