← Search

Guillem Ramírez

1 accepted papers

2024

Cache & Distil: Optimising API Calls to Large Language Models

ACL 2024findings

Large-scale deployment of generative AI tools often depends on costly API calls to a Large Language Model (LLM) to fulfil user queries, a process that also exposes the request stream to external providers. To curtail the frequency of these calls, one can employ a local smaller language model -a stud…