2023
Fast Offline Policy Optimization for Large Scale Recommendation
AAAI 2023technical
Personalised interactive systems such as recommender systems require selecting relevant items from massive catalogs dependent on context. Reward-driven offline optimisation of these systems can be achieved by a relaxation of the discrete problem resulting in policy learning or REINFORCE style learni…