Adaptation de faible rang
L'Adaptation de Bas Rang (LoRA) est une technique d'Ajustement Fin Efficace en Paramètres (PEFT) conçue pour adapter de grands modèles pré-entraînés, tels que les Grands Modèles de Langage (LLM), à des tâches spécifiques en aval sans réentraîner tous les paramètres originaux du modèle. Au lieu de mettre à jour l'intégralité de la matrice de poids massive, LoRA injecte de petites matrices de décomposition de rang entraînables dans les couches du modèle.
L'ajustement fin traditionnel nécessite des ressources informatiques considérables, y compris d'énormes quantités de mémoire GPU et de temps, surtout lorsqu'il s'agit de modèles contenant des milliards de paramètres. LoRA réduit drastiquement cette exigence. En n'entraînant qu'une infime fraction de nouvelles matrices de bas rang, il rend la personnalisation des modèles de pointe accessible aux chercheurs et aux entreprises disposant de matériel limité.
Au cœur de son fonctionnement, LoRA approxime la mise à jour d'une grande matrice de poids, $\Delta W$, comme le produit de deux matrices beaucoup plus petites, $A$ et $B$. Mathématiquement, $\Delta W \approx BA$, où le rang ($r$) de la décomposition est significativement plus petit que les dimensions de la matrice originale. Pendant l'entraînement, seuls les paramètres des matrices $A$ et $B$ sont mis à jour, tandis que les poids pré-entraînés originaux et figés ($W_0$) restent intacts. Le résultat final est calculé en ajoutant le changement adapté au poids original : $W' = W_0 + BA$.
LoRA est largement adopté dans diverses applications d'IA :
Les avantages de l'utilisation de LoRA sont substantiels pour les pipelines MLOps :
Bien qu'extrêmement efficace, LoRA n'est pas sans limites. Le choix du rang ($r$) est un hyperparamètre critique ; le définir trop bas peut entraîner un sous-apprentissage de la tâche, tandis que le définir trop haut diminue les gains en efficacité des paramètres. De plus, bien qu'il s'adapte bien aux connaissances spécifiques à une tâche, il ne modifie pas fondamentalement la connaissance mondiale du modèle intégrée dans les poids figés.
Cette technique fait partie du domaine plus large de l'Ajustement Fin Efficace en Paramètres (PEFT). D'autres concepts connexes incluent le Prompt Tuning, le Prefix Tuning et la Quantification, qui visent tous à réduire le coût de calcul de l'adaptation des modèles fondamentaux massifs.