2026
Implicit Turn-Wise Policy Optimization for Proactive User-LLM Interaction
ICML 2026poster
Multi-turn human-AI collaboration is fundamental to deploying interactive services such as adaptive tutoring, conversational recommendation, and professional consultation. However, optimizing these interactions via reinforcement learning is hindered by the sparsity of verifiable intermediate rewards…