Recuperação Esparsa
Busca Esparsa (Sparse Retrieval) refere-se a uma classe de técnicas de recuperação de informação que dependem de representações discretas e explícitas de texto, tipicamente usando vetores esparsos. Diferentemente dos métodos de busca densa, que mapeiam o texto em espaços vetoriais contínuos e de alta dimensão, os métodos esparsos representam documentos e consultas usando características que estão explicitamente presentes, como contagens de termos ou indicadores binários.
Em sistemas de recuperação de informação em larga escala, a eficiência e a interpretabilidade são críticas. Os métodos esparsos oferecem vantagens computacionais, particularmente na velocidade de indexação e recuperação, porque eles apenas armazenam e processam valores de características não nulos. Isso os torna altamente escaláveis para conjuntos de dados massivos onde a correspondência exata de palavras-chave ou a frequência de termos é primordial.
O mecanismo central envolve mapear o texto para um espaço de vocabulário. Cada documento ou consulta é representado como um vetor onde as dimensões correspondem aos termos do vocabulário. O valor em uma dimensão é tipicamente a frequência (por exemplo, pontuação TF-IDF) ou um indicador de presença binário desse termo no documento. A recuperação é então realizada calculando a similaridade, muitas vezes usando técnicas como similaridade de cosseno ou produto escalar, entre o vetor de consulta esparso e os vetores de documento esparsos.
A busca esparsa é amplamente empregada em mecanismos de busca tradicionais para correspondência de palavras-chave de alta precisão. Ela também é usada em arquiteturas de busca híbrida, onde complementa os modelos de busca densa para capturar tanto correspondências de termos exatas quanto significado semântico. Aplicações incluem busca de produtos em e-commerce, sistemas de gerenciamento de documentos e consulta de bases de conhecimento.
Os benefícios primários incluem alta eficiência computacional durante a indexação e consulta, excelente interpretabilidade (você pode rastrear os resultados recuperados até palavras-chave específicas correspondentes) e robustez ao lidar com consultas altamente específicas e repletas de jargões.
Uma limitação importante dos métodos esparsos é sua incapacidade de capturar inerentemente a similaridade semântica. Se uma consulta usa sinônimos ou conceitos relacionados que não estão explicitamente presentes no vocabulário do documento, a busca esparsa pode falhar em encontrar resultados relevantes, levando a um menor recall em comparação com os modelos densos.
Esta técnica é frequentemente contrastada com a Busca Densa (Dense Retrieval), que usa redes neurais para gerar embeddings contínuos. Ela também está intimamente relacionada a técnicas como BM25, que é um algoritmo de busca esparsa altamente otimizado.