2024
Cache & Distil: Optimising API Calls to Large Language Models
ACL 2024findings
Large-scale deployment of generative AI tools often depends on costly API calls to a Large Language Model (LLM) to fulfil user queries, a process that also exposes the request stream to external providers. To curtail the frequency of these calls, one can employ a local smaller language model -a stud…