2025
Boundary-to-Region Supervision for Offline Safe Reinforcement Learning
NeurIPS 2025poster
Offline safe reinforcement learning aims to learn policies that satisfy predefined safety constraints from static datasets. Existing sequence-model-based methods condition action generation on symmetric input tokens for return-to-go and cost-to-go, neglecting their intrinsic asymmetry: RTG serves as…