garde-fou piloté par les données
Un garde-fou piloté par les données (Data-Driven Guardrail) est un ensemble de contraintes automatisées et mesurables appliquées à un système ou un modèle d'IA. Contrairement aux règles statiques, ces garde-fous s'ajustent dynamiquement ou se déclenchent en fonction des entrées de données en temps réel, des sorties du modèle ou du comportement observé du système. Leur fonction principale est d'empêcher l'IA de générer du contenu nuisible, biaisé, non conforme ou hors sujet.
À mesure que les modèles d'IA deviennent plus autonomes, le risque de conséquences imprévues augmente. Les garde-fous pilotés par les données fournissent une couche de sécurité opérationnelle nécessaire. Ils garantissent que le modèle adhère à la logique métier prédéfinie, aux normes éthiques et aux exigences réglementaires (comme le RGPD ou la conformité spécifique à l'industrie) sans nécessiter une surveillance humaine constante.
La mise en œuvre implique généralement un pipeline à plusieurs étapes :
Ce concept est étroitement lié à l'Alignement de l'IA (AI Alignment), à la Dérive du Modèle (Model Drift) et au Red Teaming, car les garde-fous constituent un mécanisme pratique pour atteindre l'alignement et détecter la dérive.