Mecanismo de Atenção
O Mecanismo de Atenção é uma técnica que permite a uma rede neural artificial ponderar dinamicamente a importância de diferentes partes dos dados de entrada ao produzir uma saída. Em vez de tratar todos os elementos de entrada igualmente, a atenção permite que o modelo se concentre seletivamente nas informações mais relevantes da sequência de entrada em cada etapa do processamento.
As redes neurais recorrentes (RNNs) tradicionais frequentemente tinham dificuldades com dependências de longo alcance, sofrendo com gargalos de informação à medida que as sequências se tornavam mais longas. O Mecanismo de Atenção aborda diretamente essa limitação. Ao fornecer um foco ponderado, ele permite que os modelos mantenham o contexto em grandes volumes de dados, levando a um desempenho significativamente melhorado em tarefas complexas como tradução e sumarização de texto.
Em sua essência, a atenção calcula um conjunto de pesos. Para um elemento de saída dado, o mecanismo calcula uma pontuação que indica o quão relevante é cada elemento de entrada. Essas pontuações são normalizadas (muitas vezes usando uma função softmax) para criar os pesos de atenção. Esses pesos são então usados para calcular uma soma ponderada dos valores de entrada, resultando em um vetor de contexto altamente relevante para a tarefa atual.
O mecanismo é fundamental para as arquiteturas modernas de IA:
As principais vantagens de implementar a atenção incluem:
Apesar de seu poder, os mecanismos de atenção apresentam desafios:
Conceitos chave intimamente relacionados à atenção incluem Transformers (a arquitetura construída inteiramente em torno da atenção), Autoatenção (onde a entrada se atende a si mesma) e estruturas Codificador-Decodificador.