Immunizing Models Against Harmful Long-Horizon Fine-Tuning via Contractive Optimization Dynamics
Fine-tuning has become the default way to adapt powerful foundation models, but this also enables low-cost repurposing for harmful objectives. Existing immunization methods try to optimize local geometry or simulate short attacker horizons, and penalize observed loss drops. However, in practice, dow