MetaTrader: Learning to Generalize RL Trading Policies Beyond Offline Data
Reinforcement learning (RL) has shown significant promise in sequential portfolio optimization. A typical solution involves optimizing cumulative returns using historical offline data. However, it may produce less generalizable policies that merely