garde-fou contextuel
Un garde-fou contextuel est un ensemble de règles, de contraintes ou de couches de sécurité prédéfinies mises en œuvre au sein d'un système d'intelligence artificielle (IA), en particulier des grands modèles de langage (LLM). Contrairement aux filtres de sécurité génériques, les garde-fous contextuels sont conçus pour appliquer des limites basées sur le contexte spécifique, le domaine ou l'intention de l'utilisateur de l'application. Ils garantissent que la sortie de l'IA reste pertinente, respecte les politiques commerciales et évite de générer du contenu nuisible, biaisé ou hors sujet dans un périmètre opérationnel défini.
À mesure que les modèles d'IA sont de plus en plus intégrés dans les flux de travail commerciaux critiques, le risque d'« hallucinations », de violations de politiques ou de sorties inappropriées augmente. Les garde-fous contextuels sont essentiels pour opérationnaliser l'IA de manière responsable. Ils traduisent des directives éthiques abstraites ou des exigences de conformité spécifiques (comme le RGPD ou l'HIPAA) en contraintes techniques exploitables que le modèle doit respecter lors de la génération. Cela atténue le risque réputationnel et assure une fiabilité fonctionnelle.
La mise en œuvre implique généralement plusieurs couches :
Les garde-fous sont étroitement liés à l'Alignement de l'IA, qui est le domaine plus large visant à garantir que les objectifs de l'IA correspondent aux intentions humaines. Ils recoupent également la modération de contenu et la désinfection des entrées, qui se concentrent spécifiquement sur le filtrage des données nuisibles ou inappropriées.