Mémoire locale
La mémoire locale fait référence au stockage temporaire et rapide accessible directement par un processus, une application ou une unité de calcul spécifique. Dans le contexte de l'IA moderne, elle est souvent liée à la fenêtre de contexte immédiate ou à la mémoire de travail d'un agent en cours d'exécution, lui permettant de conserver des informations de l'interaction actuelle sans avoir à interroger une base de données externe persistante à chaque étape.
Pour les applications, en particulier les grands modèles de langage (LLM) et les agents intelligents, la mémoire locale est cruciale pour maintenir la cohérence conversationnelle et l'état opérationnel. Sans elle, chaque invite serait traitée comme une interaction entièrement nouvelle, entraînant une perte de contexte et des réponses absurdes. Cela a un impact direct sur l'intelligence perçue et l'utilisabilité du logiciel.
Techniquement, la mémoire locale utilise la RAM ou des couches de cache rapides. Lorsqu'un agent traite une entrée, les données précédentes pertinentes (par exemple, les cinq derniers échanges, les variables temporaires ou les documents récemment consultés) sont chargées dans ce tampon local. Cela permet au modèle de référencer ces données instantanément lors de la génération de jetons, réduisant considérablement la latence par rapport à la récupération de données depuis un disque ou une API distante.