2026
GIPO: Gaussian Importance Sampling Policy Optimization
ICML 2026poster
Post-training with reinforcement learning (RL) has recently shown strong promise for advancing multimodal agents beyond supervised imitation. However, RL remains limited by poor data efficiency, particularly in settings where interaction data are scarce and quickly become outdated. To address this c…