Classifieur explicable
Un classifieur explicable est un type de modèle d'apprentissage automatique conçu non seulement pour faire des prédictions (classification), mais aussi pour fournir des raisons compréhensibles par l'homme pour ces prédictions. Contrairement aux modèles « boîte noire », qui donnent un résultat sans justification claire, les classifieurs explicables offrent des aperçus sur les caractéristiques d'entrée qui ont conduit à la décision finale.
Dans les domaines à enjeux élevés tels que la finance, la santé et les systèmes autonomes, savoir pourquoi une IA a pris une décision est aussi crucial que la décision elle-même. L'explicabilité renforce la confiance des utilisateurs, satisfait aux exigences réglementaires (comme le « droit à l'explication » du RGPD) et permet aux experts du domaine de déboguer ou de valider la logique du modèle.
L'explicabilité peut être obtenue grâce à des modèles intrinsèquement transparents (comme la régression linéaire ou les arbres de décision) ou en appliquant des techniques post-hoc à des modèles complexes (comme les réseaux neuronaux profonds). Les méthodes post-hoc, telles que SHAP (SHapley Additive exPlanations) ou LIME (Local Interpretable Model-agnostic Explanations), approximent le comportement du modèle complexe localement pour générer des scores d'importance des caractéristiques pour une prédiction spécifique.
Atteindre une interprétabilité parfaite tout en maintenant une précision prédictive élevée est un compromis constant. De plus, générer des explications pour des modèles extrêmement volumineux et complexes peut être coûteux en termes de calcul.
Les concepts connexes comprennent les méthodes agnostiques au modèle, l'importance des caractéristiques et la robustesse aux attaques adverses.