Récupérateur de connaissances
Un récupérateur de connaissances (Knowledge Retriever) est un composant au sein d'un système d'IA, généralement utilisé conjointement avec les grands modèles de langage (LLM), conçu pour trouver et récupérer des informations factuelles et pertinentes à partir d'une base de connaissances externe prédéfinie. Au lieu de se fier uniquement aux paramètres appris lors de son entraînement initial, il extrait des documents, des passages ou des points de données spécifiques pertinents pour la requête de l'utilisateur.
L'importance principale d'un récupérateur de connaissances réside dans l'atténuation des limites inhérentes aux LLM. Les LLM sont sujets à l'« hallucination » — générer des informations plausibles mais factuellement incorrectes. En ancrant la réponse du LLM dans des données externes vérifiables et à jour, le récupérateur garantit l'exactitude, la pertinence et la traçabilité.
Le processus suit généralement un modèle de Génération Augmentée par Récupération (Retrieval-Augmented Generation ou RAG). Premièrement, la requête de l'utilisateur est encodée en une représentation vectorielle. Ce vecteur est ensuite utilisé pour rechercher dans une base de données vectorielle contenant les plongements (embeddings) des documents de la base de connaissances. Le système récupère les 'k' morceaux de texte les plus sémantiquement similaires. Enfin, ces morceaux récupérés sont transmis au LLM en tant que contexte, lui demandant de générer une réponse basée uniquement sur les preuves fournies.
Les récupérateurs de connaissances sont essentiels dans les applications d'entreprise nécessitant une haute fidélité :
Bases de données vectorielles, Modèles d'incorporation (Embedding Models), Génération Augmentée par Récupération (RAG), Recherche sémantique, Extraction d'informations.