Mise en cache des invites
Le prompt caching (mise en cache des invites) est une technique utilisée dans les applications qui interagissent avec des grands modèles de langage (LLM) ou d'autres services d'intelligence artificielle générative. Elle consiste à stocker les invites d'entrée et leurs sorties correspondantes (ou résultats intermédiaires) dans un magasin de mémoire rapide et accessible. Lorsqu'une invite identique ou très similaire est soumise à nouveau, le système récupère la réponse mise en cache au lieu de réexécuter le processus d'inférence coûteux en calcul sur le LLM.
Dans les environnements de production, de nombreux utilisateurs soumettent des requêtes répétitives, en particulier pendant les tests, le développement itératif ou lors de l'utilisation de flux de travail standardisés. Sans mise en cache, chaque requête identique oblige le LLM à effectuer un passage avant complet à travers son réseau neuronal, ce qui consomme d'importantes ressources de calcul (temps GPU) et entraîne des coûts d'API directs. Le prompt caching répond directement à ces inefficacités.
Lorsqu'une requête arrive, le système vérifie d'abord le cache à l'aide d'une fonction de hachage ou d'une métrique de similarité dérivée de l'invite. Si une correspondance est trouvée, le résultat stocké est retourné instantanément. S'il n'y a pas de correspondance, l'invite est envoyée au LLM pour traitement. Une fois que le LLM renvoie la réponse, le système stocke à la fois l'invite et la sortie générée dans le cache avant de retourner le résultat à l'utilisateur. Les stratégies d'invalidation du cache sont cruciales pour garantir que des données périmées ne soient pas servies.
Le prompt caching est très efficace dans plusieurs scénarios :
Les avantages de la mise en œuvre du prompt caching sont multiples :
Bien que puissant, le prompt caching introduit de la complexité :
Les concepts connexes comprennent les bases de données vectorielles (utilisées pour la recherche de similarité sémantique dans le cache), la quantification de modèle (une technique pour réduire la taille/le coût du modèle) et la gestion de session (suivi du contexte utilisateur à travers plusieurs invites).