Ajustement fin supervisé
Le Supervised Fine-Tuning (SFT) est un processus essentiel en apprentissage automatique appliqué où un modèle pré-entraîné à grande échelle est entraîné davantage sur un ensemble de données plus petit, de haute qualité et étiqueté, spécifique à une tâche cible. L'objectif est d'adapter les connaissances générales intégrées dans le modèle de base pour qu'il excelle dans des exigences de niche et spécifiques à un domaine.
Les modèles à usage général, bien que puissants, manquent souvent de la nuance requise pour les applications d'entreprise spécialisées. Le SFT comble cette lacune en injectant l'expertise du domaine directement dans les poids du modèle. Cela donne des résultats non seulement grammaticalement corrects, mais aussi contextuellement précis et alignés sur des protocoles commerciaux ou un jargon industriel spécifiques.
Le processus commence par un modèle de fondation (par exemple, un grand modèle transformeur) qui a déjà été entraîné sur des ensembles de données massifs et diversifiés. Dans le SFT, ce modèle est ensuite exposé à des paires de invites d'entrée et aux sorties désirées fournies par des experts. Le modèle ajuste itérativement ses paramètres internes pour minimiser la différence entre ses prédictions et les étiquettes de vérité terrain fournies dans l'ensemble de données de réglage fin.
Le SFT est largement utilisé dans diverses fonctions commerciales :
Les principaux avantages du SFT comprennent des gains de performance significatifs sur les tâches cibles, une latence d'inférence réduite par rapport à l'utilisation d'instructions complexes avec des modèles massifs, et une meilleure adhésion à la voix de la marque ou aux contraintes réglementaires.
Les défis clés concernent la qualité et la quantité des données étiquetées. Des données d'entraînement mal sélectionnées ou biaisées entraîneront un modèle mal réglé. De plus, les ressources informatiques nécessaires au processus de réglage fin lui-même peuvent être considérables.
Ce processus est étroitement lié à l'Apprentissage par Renforcement à partir de Rétroaction Humaine (RLHF), qui suit souvent le SFT pour aligner davantage le comportement du modèle après le réglage initial spécifique à la tâche.