Jalon Explicable
Un banc d'essai explicable est un ensemble standardisé de tests conçu non seulement pour mesurer la performance brute (précision, score F1) d'un modèle d'intelligence artificielle, mais aussi pour quantifier comment et pourquoi il parvient à ses décisions. Contrairement aux bancs d'essai traditionnels qui se concentrent uniquement sur les métriques de sortie, ces bancs d'essai intègrent des métriques liées à l'interprétabilité, à la robustesse et à l'équité.
Dans les applications critiques — telles que le diagnostic médical, l'approbation de prêts ou la conduite autonome — un score de précision élevé est insuffisant. Les parties prenantes exigent l'assurance que le modèle fonctionne de manière logique et éthique. Les bancs d'essai explicables comblent le fossé entre une haute performance et une haute confiance, permettant aux développeurs et aux régulateurs d'auditer le processus de raisonnement de l'IA.
Ces bancs d'essai intègrent diverses couches d'évaluation. Au-delà des métriques standard, ils exigent souvent que le modèle produise des explications (par exemple, des scores d'importance des caractéristiques, des exemples contrefactuels) en plus de sa prédiction. Le banc d'essai évalue ensuite la qualité, la stabilité et la fidélité de ces explications par rapport à la vérité terrain ou aux attentes humaines.
Le développement de bancs d'essai explicables robustes est complexe car une explication « bonne » est subjective. Il n'existe pas de norme universelle sur ce qui constitue une explication suffisamment claire ou fidèle dans tous les domaines.
Ce concept est étroitement lié à l'IA explicable (XAI), à l'interprétabilité des modèles et aux tests de robustesse adversariale.