Politique neuronale
Une Politique Neuronale (Neural Policy) fait référence à une fonction, généralement implémentée à l'aide d'un réseau neuronal, qui mappe les états observés d'un environnement à une distribution de probabilité sur les actions possibles. Dans le contexte de l'Apprentissage par Renforcement (AR), ce réseau est la politique ($\pi$). Au lieu d'utiliser une table de consultation, la politique apprend des mappages complexes, continus ou de haute dimension directement à partir des données sensorielles brutes.
Les systèmes de contrôle traditionnels reposent souvent sur des règles préprogrammées ou des mappages état-action simples. Les Politiques Neuronales permettent aux agents d'IA de gérer des environnements dotés d'espaces d'états vastes, continus ou partiellement observables — des situations où la création manuelle de règles est impossible ou computationnellement irréalisable. Elles permettent aux agents d'apprendre des comportements sophistiqués et adaptatifs qui se généralisent bien à des scénarios inédits.
Le processus implique l'entraînement du réseau neuronal à l'aide d'algorithmes d'AR, tels que les Gradientes de Politique (Policy Gradients, par exemple REINFORCE, A2C) ou les méthodes Acteur-Critique (Actor-Critic). L'agent interagit avec l'environnement, reçoit des récompenses ou des pénalités, et utilise ces signaux pour ajuster les poids du réseau neuronal. La sortie du réseau dicte la probabilité de prendre chaque action dans un état donné, définissant ainsi efficacement la stratégie de comportement de l'agent.
Les Politiques Neuronales sont fondamentales dans plusieurs applications avancées :
Ce concept est étroitement lié aux Fonctions de Valeur (qui estiment les récompenses futures attendues), à l'Apprentissage Q (Q-Learning, qui apprend les valeurs d'action optimales) et aux architectures Acteur-Critique (qui combinent l'apprentissage de politique avec l'estimation de valeur).