Definição
Contexto de Curto Prazo refere-se ao conjunto imediato e limitado de informações precedentes que um modelo de IA, particularmente um Modelo de Linguagem Grande (LLM) ou agente conversacional, pode considerar ativamente ao gerar sua próxima saída. É a 'memória de trabalho' do sistema para uma interação ou sessão específica.
Diferentemente da memória de longo prazo, que armazena vastas quantidades de dados históricos, o contexto de curto prazo é limitado pela janela de contexto fixa do modelo — o número máximo de tokens (palavras ou subpalavras) que ele pode processar simultaneamente.
Por Que Isso Importa
A qualidade e o tamanho do contexto de curto prazo ditam diretamente a coerência, a relevância e a precisão das respostas de uma IA. Se a janela de contexto for muito pequena, o modelo 'esquece' partes anteriores da conversa, levando a saídas sem sentido ou repetitivas. O gerenciamento eficaz do contexto é crucial para construir experiências conversacionais confiáveis e semelhantes às humanas.
Como Funciona
Quando um usuário insere um prompt, o sistema agrupa esse prompt com as interações anteriores do diálogo (o histórico da conversa) em uma única sequência de entrada. Essa sequência, que constitui o contexto de curto prazo, é alimentada na arquitetura transformer. O modelo então usa mecanismos de atenção para ponderar a importância de cada token dentro dessa janela limitada para prever o próximo token mais provável.
Casos de Uso Comuns
- Chatbots e Assistentes Virtuais: Manter a relevância do tópico ao longo de várias trocas de mensagens.
- Geração de Código: Lembrar definições de variáveis ou assinaturas de funções fornecidas anteriormente no prompt.
- Sumarização: Garantir que o resumo reflita com precisão os pontos-chave apresentados no documento de origem imediato.
- Rastreamento de Estado do Diálogo: Manter o controle das preferências ou restrições do usuário mencionadas momentos antes.
Benefícios Principais
- Coerência: Garante que a IA permaneça no tópico e mantenha o fluxo da conversa.
- Relevância: Permite que o modelo adapte as respostas com base no histórico de entrada imediato.
- Eficiência: Processar uma janela de contexto limitada é computacionalmente mais eficiente do que tentar carregar todo o histórico de um banco de dados.
Desafios
- Limites da Janela de Contexto: O limite rígido de tokens restringe a profundidade do raciocínio complexo e de múltiplas etapas.
- Inundação de Contexto (Context Stuffing): Sobrecargar o contexto com dados irrelevantes pode diluir o sinal, levando a um desempenho pior.
- Latência: Processar janelas de contexto mais longas aumenta a carga computacional e o tempo de resposta.
Conceitos Relacionados
- Memória de Longo Prazo: Bancos de dados externos ou vector stores usados para recuperar informações fora da janela de contexto imediata.
- Mecanismo de Atenção: A função central da rede neural que determina quais partes do contexto de curto prazo são mais relevantes para a previsão atual.
- Tokenização: O processo de decompor o texto em unidades discretas (tokens) que o modelo realmente processa.