Agent de garde-fou
Un garde-fou d'agent (Agent Guardrail) est un ensemble de règles prédéfinies, de contraintes et de mécanismes de sécurité mis en œuvre au sein d'un agent IA autonome ou d'une application de grand modèle de langage (LLM). Ces garde-fous agissent comme une frontière, dictant ce que l'agent est autorisé à faire, quel type de sortie il doit produire et comment il doit se comporter dans diverses conditions opérationnelles.
À mesure que les agents IA deviennent plus autonomes, le risque de comportements non intentionnels ou nuisibles augmente. Les garde-fous sont essentiels pour atténuer des risques tels que la génération de contenu biaisé, l'exécution d'actions non autorisées, la fuite de données sensibles ou l'entrée dans des boucles infinies. Ils garantissent que l'agent opère dans les paramètres éthiques, légaux et commerciaux définis.
Les garde-fous opèrent à plusieurs niveaux du pipeline de l'agent. Cela peut inclure la validation des entrées (vérification des invites utilisateur pour détecter une intention malveillante), le filtrage des sorties (nettoyage des réponses pour les violations de politique) et les contraintes d'exécution (limitation des appels API ou de l'utilisation d'outils externes). Ils impliquent souvent des modèles secondaires plus petits ou des vérifications logiques déterministes qui examinent l'action proposée par l'agent principal avant qu'elle ne soit exécutée.
La mise en œuvre de garde-fous efficaces est complexe. Des garde-fous trop restrictifs peuvent entraîner un « sur-filtrage », où l'agent refuse de répondre à des requêtes valides, ce qui entraîne une mauvaise expérience utilisateur. Inversement, des garde-fous faibles laissent le système vulnérable aux attaques par injection de prompt ou par contournement (jailbreaking).
Ce concept est étroitement lié à l'Alignement de l'IA (AI Alignment), qui est le domaine plus large assurant que les systèmes d'IA agissent conformément aux valeurs humaines, et à l'Ingénierie des invites (Prompt Engineering), qui se concentre sur l'élaboration des entrées pour guider le comportement du modèle.