Política Neural
Uma Política Neural refere-se a uma função, tipicamente implementada usando uma rede neural, que mapeia estados observados de um ambiente para uma distribuição de probabilidade sobre ações possíveis. No contexto do Aprendizado por Reforço (RL), esta rede é a política ($\pi$). Em vez de usar uma tabela de consulta, a política aprende mapeamentos complexos, contínuos ou de alta dimensão diretamente a partir de dados sensoriais brutos.
Sistemas de controle tradicionais frequentemente dependem de regras pré-programadas ou mapeamentos simples de estado-ação. As Políticas Neurais permitem que agentes de IA lidem com ambientes que possuem espaços de estados vastos, contínuos ou parcialmente observáveis — situações onde a criação manual de regras é impossível ou computacionalmente intratável. Elas permitem que os agentes aprendam comportamentos sofisticados e adaptativos que se generalizam bem para cenários não vistos.
O processo envolve treinar a rede neural usando algoritmos de RL, como Gradientes de Política (por exemplo, REINFORCE, A2C) ou métodos Actor-Critic. O agente interage com o ambiente, recebe recompensas ou penalidades e usa esses sinais para ajustar os pesos da rede neural. A saída da rede dita a probabilidade de tomar cada ação em um determinado estado, definindo efetivamente a estratégia de comportamento do agente.
As Políticas Neurais são fundamentais em várias aplicações avançadas:
Este conceito está intimamente relacionado às Funções de Valor (que estimam recompensas futuras esperadas), Q-Learning (que aprende valores de ação ótimos) e arquiteturas Actor-Critic (que combinam o aprendizado de política com a estimação de valor).