COLING 2025main2 citations

Persona-Consistent Dialogue Generation via Pseudo Preference Tuning

Junya Takayama, Masaya Ohagi, Tomoya Mizumoto, Katsumasa Yoshikawa

Abstract

We propose a simple yet effective method for enhancing persona consistency in dialogue response generation using Direct Preference Optimization (DPO). In our method, we generate responses from the response generation model using persona information that has been randomly swapped with data from other dialogues, treating these responses as pseudo-negative samples. The reference responses serve as positive samples, allowing us to create pseudo-preference data. Experimental results demonstrate that our model, fine-tuned with DPO on the pseudo preference data, produces more consistent and natural responses compared to models trained using supervised fine-tuning or reinforcement learning approaches based on entailment relations between personas and utterances.

BibTeX
@inproceedings{takayama-etal-2025-persona,
    title = "Persona-Consistent Dialogue Generation via Pseudo Preference Tuning",
    author = "Takayama, Junya  and
      Ohagi, Masaya  and
      Mizumoto, Tomoya  and
      Yoshikawa, Katsumasa",
    editor = "Rambow, Owen  and
      Wanner, Leo  and
      Apidianaki, Marianna  and
      Al-Khalifa, Hend  and
      Eugenio, Barbara Di  and
      Schockaert, Steven",
    booktitle = "Proceedings of the 31st International Conference on Computational Linguistics",
    month = jan,
    year = "2025",
    address = "Abu Dhabi, UAE",
    publisher = "Association for Computational Linguistics",
    url = "https://aclanthology.org/2025.coling-main.369/",
    pages = "5507--5514"
}
Persona-Consistent Dialogue Generation via Pseudo Preference Tuning · COLING 2025