2025
Structured Preference Optimization for Vision-Language Long-Horizon Task Planning
EMNLP 2025
Existing vision-language planning methods perform well on short-horizon tasks but struggle with long-horizon reasoning in dynamic environments due to the difficulty of training models to generate high-quality reasoning processes. To address this, we propose Structured Preference Optimization (SPO),