Mémoire hybride
La mémoire hybride fait référence à une approche architecturale dans l'IA et les grands modèles de langage (LLM) où plusieurs types distincts de stockage de mémoire sont intégrés et utilisés simultanément. Au lieu de dépendre d'une seule base de données ou d'une seule fenêtre de contexte, un système hybride combine stratégiquement une mémoire rapide et volatile (comme la RAM ou le cache) avec un stockage persistant plus lent (comme les bases de données vectorielles ou les bases de données SQL/NoSQL traditionnelles).
Dans les applications d'IA complexes, le volume et la variété des informations requises dépassent souvent la capacité d'un seul composant de mémoire. La mémoire hybride résout le compromis entre vitesse et échelle. Elle permet aux modèles d'accéder instantanément à un contexte immédiat et très pertinent tout en conservant simultanément de vastes quantités de connaissances historiques à long terme pour un raisonnement plus approfondi.
Le système fonctionne en acheminant les requêtes d'information vers la couche de mémoire la plus appropriée. Le contexte conversationnel à court terme et immédiat est généralement conservé dans une mémoire volatile à haute vitesse. Pour récupérer des faits spécifiques ou des interactions passées, le système interroge une base de connaissances spécialisée, souvent une base de données vectorielle, qui stocke des plongements (embeddings) des données passées. Les données structurées à long terme peuvent résider dans une base de données relationnelle, accessible via un pipeline de génération augmentée par récupération (RAG).