Ajustement par instruction
L'ajustement par instructions (Instruction Tuning) est une technique de fine-tuning appliquée aux grands modèles de langage pré-entraînés (LLM). Au lieu d'entraîner le modèle uniquement sur des corpus de texte massifs et non structurés, l'ajustement par instructions entraîne le modèle sur un ensemble de données organisé de paires requête-réponse. Ces paires démontrent explicitement les comportements souhaités, tels que répondre à des questions, résumer des textes ou suivre des commandes spécifiques.
L'objectif principal de l'ajustement par instructions est d'aligner la connaissance générale d'un LLM de base avec les instructions spécifiques et exploitables d'un utilisateur humain. Un LLM de base peut être compétent mais non guidé ; l'ajustement par instructions le transforme en un assistant capable qui exécute les tâches de manière fiable comme prévu. Cet alignement est crucial pour faire passer les LLM du statut de curiosités de recherche à celui d'outils d'entreprise fiables.
Le processus implique de collecter ou de synthétiser des exemples de haute qualité où une entrée (l'instruction/la requête) est associée à une sortie idéale (la réponse souhaitée). Le modèle est ensuite entraîné en utilisant un fine-tuning supervisé (SFT) sur cet ensemble de données. Le modèle apprend la correspondance entre le format de l'instruction et le format de sortie correct, apprenant ainsi comment suivre les directives, et pas seulement quelles informations existent.
L'ajustement par instructions permet un déploiement pratique dans diverses fonctions commerciales :
Cette technique est étroitement liée à l'Apprentissage par Renforcement à partir de Rétroaction Humaine (RLHF), qui suit souvent l'ajustement par instructions pour affiner davantage l'alignement des préférences du modèle après la phase initiale d'ajustement supervisé.