← Search

Zhenbang Dai

1 accepted papers

2025

Visualising Policy-Reward Interplay to Inform Zeroth-Order Preference Optimisation of Large Language Models

ACL 2025finding

Fine-tuning Large Language Models (LLMs) with first-order methods like back-propagation is computationally intensive. Zeroth-Order (ZO) optimisation uses function evaluations instead of gradients, reducing memory usage, but suffers from slow convergence in high-dimensional models. As a result, ZO re…