Distillation de modèle
La distillation de modèles est une technique de compression de modèles où un modèle volumineux et performant (le modèle « Enseignant ») est utilisé pour entraîner un modèle plus petit et plus simple (le modèle « Élève »). Au lieu d'entraîner le modèle Élève uniquement sur les étiquettes de vérité terrain, il est également entraîné à imiter les probabilités de sortie (les « cibles douces ») générées par le modèle Enseignant.
Dans l'IA moderne, les modèles de pointe sont souvent massifs, nécessitant des ressources informatiques considérables (latence élevée, empreinte mémoire importante). Cela rend leur déploiement difficile sur des appareils aux ressources limitées tels que les téléphones mobiles, les capteurs IoT ou dans des environnements de calcul en périphérie (edge computing) en temps réel. La distillation permet aux organisations de conserver une grande partie de la connaissance complexe de l'Enseignant tout en réduisant considérablement la taille et le temps d'inférence de l'Élève.
Le mécanisme de base implique le transfert de « connaissances cachées » (dark knowledge). Le modèle Enseignant produit non seulement une prédiction nette (par exemple, « Chat »), mais une distribution de probabilité sur toutes les classes possibles (par exemple, 90 % Chat, 8 % Chien, 2 % Oiseau). Cette distribution contient des informations nuancées sur l'incertitude du modèle et les relations entre les classes. Le modèle Élève est ensuite entraîné en utilisant une fonction de perte combinée : un composant minimise la différence entre ses prédictions et les étiquettes réelles (cibles dures), et un second composant minimise la différence entre ses prédictions et les cibles douces de l'Enseignant.