2025
Better Language Model Inversion by Compactly Representing Next-Token Distributions
NeurIPS 2025poster
Language model inversion seeks to recover hidden prompts using only language model outputs. This capability has implications for security and accountability in language model deployments, such as leaking private information from an API-protected language model’s system message. We propose a new meth…