Fenêtre de contexte
La fenêtre de contexte fait référence à la quantité maximale de texte d'entrée (invite) et de texte de sortie (complétion) qu'un grand modèle linguistique (LLM) peut traiter ou « mémoriser » au cours d'une seule interaction. Cette capacité est mesurée en jetons (tokens), où un jeton est approximativement équivalent à un mot ou à une unité de sous-mot.
La taille de la fenêtre de contexte dicte directement la complexité et l'étendue des tâches qu'un LLM peut gérer. Une fenêtre plus grande permet au modèle de maintenir la cohérence sur des conversations beaucoup plus longues, d'analyser des documents volumineux et de faire référence à des parties antérieures d'une entrée complexe sans perdre le fil général.
Les modèles basés sur les transformeurs, qui alimentent la plupart des LLM modernes, traitent les informations séquentiellement dans cette limite de jetons définie. Lorsque l'entrée dépasse la fenêtre de contexte, le modèle doit tronquer les informations les plus anciennes, ce qui lui fait effectivement « oublier » le début de la conversation ou du document.