Évaluateur intégré
Un évaluateur intégré (Embedded Evaluator) est un composant intégré directement dans un pipeline d'IA ou d'apprentissage automatique. Contrairement aux suites de tests externes et post-hoc, un évaluateur intégré évalue la performance, la qualité ou le respect des contraintes d'un modèle ou d'un agent pendant son fonctionnement ou son processus de génération. Il agit comme une porte de contrôle de qualité interne.
Dans les applications complexes et en temps réel, attendre une exécution de test par lots est insuffisant. Les évaluateurs intégrés permettent une validation continue, garantissant que la sortie de l'IA reste pertinente, sûre et précise lorsqu'elle interagit avec des données ou des utilisateurs en direct. Cela déplace l'assurance qualité plus tôt dans le cycle de développement.
Ces évaluateurs fonctionnent en appliquant des métriques prédéfinies ou des modèles spécialisés à la sortie en direct. Pour l'IA générative, cela peut impliquer de vérifier la cohérence factuelle, la toxicité ou le respect d'un ton spécifique. Pour les agents de prise de décision, cela peut impliquer de vérifier que l'action choisie correspond à l'état objectif initial. La logique d'évaluation est étroitement couplée à l'environnement d'exécution.
Ce concept est étroitement lié à l'Apprentissage par Renforcement à partir de Rétroaction Humaine (RLHF), aux cadres de test automatisés et à l'implémentation de garde-fous dans les grands modèles de langage (LLM).