2026
Aligning Machiavellian Agents: Behavior Steering via Test-Time Policy Shaping
AAAI 2026technical
The deployment of decision-making AI agents presents a critical challenge in maintaining alignment with human values or guidelines while operating in complex, dynamic environments. Agents trained solely to achieve their objectives may adopt harmful behavior, exposing a key trade-off between maximizi