Temporal-Spatial Representation Fusion for Dexterous Manipulation Learning with Unpaired Visual-Action Data
Supervised behavioral cloning using robot visual-action data has been widely investigated in robot manipulation. However, these methods typically require simultaneous acquisition of visual and action data, which makes them difficult to utilize unpaired visual-action datasets: e.g. videos on Internet