Définition
Dans le contexte des grands modèles de langage (LLM) et de l'IA générative, le Budget de Jetons (Token Budget) fait référence au nombre maximal de jetons qu'une application ou un utilisateur est autorisé à traiter au cours d'une interaction, d'un appel API ou d'une période d'utilisation spécifique. Les jetons sont les unités fondamentales de texte que les LLM utilisent pour traiter l'information ; ils peuvent représenter des mots, des sous-mots ou des caractères.
Ce budget dicte la taille totale de l'entrée (invite ou prompt) et la taille totale de la sortie (complétion) que le modèle peut gérer simultanément, ce qui a un impact direct sur la latence et le coût opérationnel.
Pourquoi c'est important
La gestion du Budget de Jetons est essentielle pour plusieurs raisons commerciales :
- Contrôle des coûts : L'utilisation des LLM est généralement facturée par jeton. Dépasser un budget ou envoyer des invites excessivement longues peut entraîner des dépenses opérationnelles imprévisibles et élevées.
- Performance et latence : Des entrées ou des sorties extrêmement volumineuses peuvent solliciter la capacité de traitement du modèle, entraînant des temps de réponse plus lents.
- Contraintes système : De nombreuses API imposent des limites strictes sur la taille de la fenêtre de contexte. Le respect du budget garantit que l'application reste fonctionnelle dans les spécifications techniques du fournisseur.
Comment cela fonctionne
Le processus de tokenisation décompose le texte brut en jetons discrets. Par exemple, le mot « tokenization » pourrait être décomposé en plusieurs jetons. Le Budget de Jetons est généralement défini par la taille de la fenêtre de contexte du modèle (par exemple, 4096 jetons). Cette fenêtre doit accueillir à la fois l'invite d'entrée et la réponse attendue.
Si votre invite consomme 3000 jetons, et que la fenêtre de contexte maximale du modèle est de 4096 jetons, votre budget restant pour la réponse n'est que de 1096 jetons.
Cas d'utilisation courants
- Chatbots et IA conversationnelle : Limiter le budget empêche les boucles infinies ou les historiques de conversation excessivement longs d'entraîner une augmentation des coûts.
- Résumé de données : Lors du résumé de documents volumineux, définir un budget garantit que la sortie est concise et correspond aux limites de traitement en aval.
- Orchestration d'agents : Dans les agents IA multi-étapes, le budget contrôle la complexité de la chaîne de raisonnement avant qu'une action finale ne soit entreprise.
Avantages clés
- Dépenses prévisibles : L'établissement de budgets clairs permet aux équipes financières de prévoir avec précision les coûts opérationnels de l'IA.
- Expérience utilisateur optimisée (UX) : En gérant la longueur des entrées, les développeurs peuvent s'assurer que l'utilisateur reçoit des réponses rapides et pertinentes.
- Efficacité des ressources : Cela empêche le gaspillage de ressources informatiques sur des données trop verbeuses ou non pertinentes.
Défis
- Gestion du contexte : Déterminer la quantité optimale de données historiques à inclure dans l'invite sans dépasser le budget est un exercice d'équilibre constant.
- Imprécision de l'estimation des jetons : Bien que des outils existent, prédire avec précision le nombre exact de jetons de données complexes et non structurées avant de les envoyer peut être difficile.
Concepts connexes
- Fenêtre de contexte : La capacité totale de jetons que le modèle peut prendre en compte à un moment donné.
- Ingénierie des invites (Prompt Engineering) : La pratique consistant à structurer les entrées pour obtenir la sortie désirée et efficace.
- Coût d'inférence : La dépense opérationnelle associée à l'exécution du modèle pour générer une réponse.