← Search

Qunzhi Lin

1 accepted papers

2026

GIPO: Gaussian Importance Sampling Policy Optimization

ICML 2026poster

Post-training with reinforcement learning (RL) has recently shown strong promise for advancing multimodal agents beyond supervised imitation. However, RL remains limited by poor data efficiency, particularly in settings where interaction data are scarce and quickly become outdated. To address this c…

Cited by 0SourceScholar