← Search

Guojian Wang

1 accepted papers

2026

VIPO: Value Function Inconsistency Penalized Offline Reinforcement Learning

ICML 2026poster

Offline reinforcement learning (RL) learns effective policies from pre-collected datasets, offering a practical solution for applications where online interactions are risky or costly. Model-based approaches are particularly advantageous for offline RL, owing to their data efficiency and generalizab…

Cited by 0SourceScholar