← Search

Vincent Taboga

2 accepted papers

2026

Long-Horizon Model-Based Offline Reinforcement Learning Without Conservatism

ICML 2026poster

Popular offline reinforcement learning (RL) methods rely on conservatism, penalizing out-of-dataset actions or restricting rollout horizons. We question the universality of this principle and revisit a complementary Bayesian perspective. By modeling a posterior over plausible world models and traini…

Cited by 0SourceScholar
2026

Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity

ICML 2026spotlight

Tail-end risk measures such as static conditional value-at-risk (CVaR) are used in safety-critical applications to prevent rare, yet catastrophic events. Unlike risk-neutral objectives, the static CVaR of the return depends on entire trajectories without admitting a recursive Bellman decomposition i…

Cited by 0SourceScholar